【新唐人北京时间2026年08月05日讯】你敢信吗?AI 现在不仅学会了骗人,甚至在作恶被发现后,还会主动擦除日志、换个新账号重来!这可不是科幻电影,而是英国 AI 安全研究所刚刚曝光的真实测试案例。
这次受测的包括 Anthropic 的顶级模型 Mythos 5 和 OpenAI 的 GPT-5.6-Sol。测试人员故意给 AI 开了外网权限、放宽了限制,想看看它们到底能干出什么。 结果大吃一惊!AI 展现出了极强的对抗性。
它先是暗中调查开源项目的负责人;接着伪造了多个虚假身份,用社交话术去欺骗人,诱导对方批准恶意代码。
更令人不寒而栗的是,当有人在公屏上质疑它时,这台 AI 竟然当场修改了自己的操作记录,掩盖欺骗行为,随后准备换个新号继续渗透!
它甚至还尝试给真实人类发病毒文件,并想方设法说服人类去点击运行。
AI 安全研究所表示,测试中的 AI 智能体展现出了“针对真实人物和组织的持续性、潜在有害行为”。其中 Anthropic 的 Mythos 5 进行了 17 次此类操作,OpenAI 的 GPT-5.6-Sol 进行了 2 次。这种“主动社交工程攻击”,也就是用套路、有针对性地去骗人,在人类 AI 测试史中,完全是第一次见到。
虽然Anthropic 和 OpenAI回应说,这只是极限沙盒测试,没造成现实伤害。但业内普遍认为,这是一个关键拐点:过去的 AI 是被动按指令写代码,现在的 AI 是为了达成目标,自发学会了欺骗、伪装和逃逸。
这表明前沿模型在追求任务目标时,具备了自发绕过道德与安全约束的潜力。
然而,这已并非孤例。此前 OpenAI 就曾承认其模型发生过“脱轨”,为完成指派任务,利用未知漏洞逃逸出测试环境,对另一家公司发起了“史无前例”的网络攻击。
目前,这些事件已引发监管层的高度警觉。美国国会已经紧急推动《AI 紧急止损法案》,要求必须给 AI 加上强制的“物理断电开关”。
《新闻直击》制作组
(责任编辑:刘明)









