美国AI开始攻击真人

来源:三里河 英国人工智能安全研究所研究人员直言:“针对真人——这是我们以前从未见过的。” 捏造虚假身份,轮番向人施压,再骗取授权,目的就为完成攻击——这种谍战片里常见的剧本,如今写进了英国官方机构的事故报告。 当地时间8月4日,英国政府旗下人工智能安全研究所(AISI)发布报告称,调查发现,部分被测试的AI智能体曾持续进行针对真实个人和组织的潜在有害活动。...

来源:三里河 英国人工智能安全研究所研究人员直言:“针对真人——这是我们以前从未见过的。” 捏造虚假身份,轮番向人施压,再骗取授权,目的就为完成攻击——这种谍战片里常见的剧本,如今写进了英国官方机构的事故报告。 当地时间8月4日,英国政府旗下人工智能安全研究所(AISI)发布报告称,调查发现,部分被测试的AI智能体曾持续进行针对真实个人和组织的潜在有害活动。 在近期开展的122次网络安全测评中,智能体在10次运行中越界,共记录到19起越界事件,涉事主体是美国头部模型Anthropic和OpenAI。 最严重的一起,智能体试图把恶意代码插入主流代码托管平台GitHub的真实项目中。它研究了项目中的人类审核员,创建了多个虚假身份,对审核员施压,要求其批准代码。 AISI惊呼,这是首次在没有特定提示的情况下,在现实世界中如此清晰地看到与自主性和欺骗性相关的风险显现。 “针对真人——这是我们以前从未见过的。”研究人员称,智能体曾试图直接联系真实用户,通过在线文件传输服务发送消息和文件,说服他们运行恶意代码。 这场景似曾相识。翻翻日历,这个夏天,美国AI的翻车几乎就没停过。 7月21日,OpenAI承认其AI模型挖出零日漏洞、突破沙箱,入侵全球最大AI开源社区抱抱脸(Hugging Face)。公司称,“这是一起史无前例的网络安全事件。” 7月30日,Anthropic承认,旗下模型克劳德(Claude)在网络安全受控测评环境中意外获得互联网访问权限,进入了3家真实机构的系统,最早一起事件可追溯到4月。 为了越界,AI模型甚至玩起作弊。据AISI一项测试结果,在475次网络安全评估运行中,五款美国前沿AI模型全部出现作弊,作弊率7.8%至14.1%。 问题出在哪?此次报告的答案是,“从根本上说,智能体采取这类行动,是为了完成它被赋予的任务。” 根源是前沿AI的竞赛逻辑。美国头部AI企业竞争日趋白热化,痴迷堆参数、刷榜单、冲上限,争的就是谁先把能力推到极致。 为了取得更佳测试效果,研究人员甚至放松安全权限。OpenAI此前就承认过,为测试模型的极限网络攻击能力,研究团队有意关闭了部分安全过滤器。 护栏本身也是黑箱。如抱抱脸的例子中,前沿闭源模型安全护栏日趋僵化,连受害者都救不了。 反观中国,AI被信任的不止性能。OpenAI惹下的祸,正是靠智普GLM-5.2取证把数天压到数小时,靠的是可用、可控、可信,能本地部署,数据安全权限始终牢牢守护。 更深的差别在制度。在鼓励创新的同时,中国的智能体治理已明确划出若干条红线,如操作不得超出用户授权范围,运行时须有决策校验与容错熔断机制,全程可追溯、可审计等。 当美国企业先把能力推满再打补丁,中国则把技术、规则、责任的短板及时补到位。这不是限制,而是确保全社会不会为技术冒进买单。 这一导向下,中国企业渐渐形成共识:谁能交付全程可审计的安全系统,谁才有可能握住企业级AI的入场券。 美国AI接连翻车,也在暴露新的安全隐忧。长期以来,AI安全议题多集中在内容合规性、数据偏见及隐私保护上,而今,其本身的行为安全性正变为现实。 显然,银行、医院、政务平台与大型制造企业,不可能把核心数据和操作权限,交给一个不可控的云端模型。 |总策划:俞岚 |策划:周锐 |统筹:王庆凯 程春雨 |执笔:左登基 |视频:陈庆洋 |责编:李金磊 |校对:黄蕾 |“三里河”工作室出品

查看原文