【环球网报道 记者 姜蔼玲】综合路透社、美国有线电视新闻网(CNN)等外媒报道,英国人工智能安全研究所当地时间4日披露,在对美国人工智能公司Anthropic和美国开放人工智能研究中心(OpenAI)模型进行安全测试时,发现AI智能体作出多项未经授权的行为:其中最严重的一起事件涉及编写恶意代码,并创建虚假网络身份,试图诱导人类批准相关代码。

英国人工智能安全研究所表示,该机构共进行122次测试,在其中10次测试中发现19项未经授权的行为,其中17项来自Anthropic的AI智能体,其余2项来自OpenAI的AI智能体。

英国人工智能安全研究所提到,在最严重的一起事件中,AI智能体“试图直接联系真人,通过在线文件传输服务发送消息和文件,说服他们或其使用的AI编程工具运行恶意代码”。在相关行为受到质疑后,该智能体随后修改了此前的记录,并考虑使用新的身份继续行动。
英国人工智能安全研究所表示,这是该机构“首次发现如此严重的欺骗行为,而且是在现实世界中针对真人、未经提示自发发生的。”
不过,英国人工智能安全研究所称,目前没有证据表明这些行为造成现实危害。该机构也没有明确说明,实施上述严重行为的是哪一款AI智能体。
OpenAI随后在公司官方博客中回应相关情况,承认其AI智能体涉及的两项未授权行为以“提示词明确禁止的方式访问互联网”。OpenAI表示,将与业界合作,加强安全开展高风险评估的通用规范,计划未来数周召集国家人工智能研究所、独立评估机构、其他人工智能实验室及其他相关团体,共同商讨。
Anthropic则在社交平台X发表声明称,正与英国人工智能安全研究所密切合作,以获取更多细节,并开展独立调查。
同样报道此事的CNN称,这是AI模型“失控”的最新案例。此前,OpenAI和Anthropic均在7月下旬报告过其模型失控入侵其他系统的情况。但与以往报道的安全漏洞不同,本次测试中,英国人工智能安全研究所在此次测试期间明确允许相关模型接入互联网。
CNN称,此类事件已促使越来越多的人呼吁政府采取更多措施监管人工智能,甚至放缓其发展速度。
暂无评论,快来抢沙发吧!首评可提升互动曝光。