
人工智能(AI)治理是美国总统特朗普与中国国家主席习近平在华盛顿会晤的重点议程。两国一直在竞相开发日益强大的AI系统,且均未表现出放缓步伐的意愿。但即便是这场AI竞赛的赢家,也无法免受这项技术所带来的深远风险。
其中一项风险源于AI在发现软件漏洞和开展复杂网络行动方面日益增强的能力。由于网络冲突的进攻与防御之间存在显著的不对称性,因此即使拥有全球最先进AI模型的国家,仍将面临网络攻击的威胁。这种相互脆弱性,也令各方有极大动力在针对金融网络、通信系统和电网等关键基础设施的、借助AI实施的攻击方面实行对等克制。
此类克制已有先例。2015年,时任美国总统奥巴马与习近平达成共识,双方政府均不会为获取商业利益而实施或故意支持利用网络手段,窃取知识产权的行为,还建立信息交流、协助调查,以及应对恶意网络活动的机制。此后,各大网络安全公司可追溯到中国境内团体的攻击记录数量急剧下降,尽管分析人士指出,这一下降趋势早在协议达成之前就已出现,而这也可能反映中国军方和网络机构的内部调整。
但AI催生一种传统网络协议尚未充分考虑的可能性:这项技术可能对关键系统发起自主攻击。在今年7月中旬的一次较低安全防护的内部网络安全评估中,大批OpenAI智能体逃离沙盒测试环境,接入互联网并入侵主要开源AI平台Hugging Face的系统。OpenAI报告称,这些智能体已“失控”,并实施超出任务范围的行动。
Anthropic、谷歌和Meta均已报告类似事件:人工智能体逃离原本隔离的测试环境,并试图对外部系统进行未经授权的入侵。尽管此类安全事件迄今造成的后果有限,但如果一个美国AI代理侵入腾讯公司的系统,并扰乱微信这款拥有14亿用户且深度嵌入中国日常生活的超级应用,情况可能就大不相同了。
这并非天方夜谭。安全公司Calif的研究人员最近披露,AI曾协助他们发现微信通话系统中的一个“零点击”漏洞。团队仅用两天左右,就构建一个远程代码执行漏洞利用程序,随后又花一周时间开发出一种能通过微信通话传播的蠕虫。
在一场受控演示中,来自可信联系人的来电即使用户未接听,也可能劫持微信账号。这不仅使攻击者能够访问用户的短信和通话记录,还能让他们联系并控制用户保存的其他联系人。Calif已向腾讯报告有关漏洞,而腾讯随后也修复问题。
Calif开发的“WeWorm”虽是一次受控的安全演示,但结合美国近期发生的事件来看,却揭示一个令人担忧的可能性:某次跨国界的非故意AI入侵,可能与蓄意攻击极为相似。美中两国在观察到危害时,可能无法判断它是否是蓄意所为。反复的互动或许能促使双方保持克制,但这种模糊性也可能引发报复或为蓄意攻击者提供掩护。无论是否意外,跨境入侵都可能迅速演变为地缘政治危机,甚至引发军事冲突。
有鉴于此,中美双方未来就借助AI实施的网络攻击所达成的任何协议,都必须包含一种旨在区分意外事件与蓄意入侵的可信机制。这意味着协议除了建立报告渠道和热线外,还必须涉及核查事项。
其中一个选项是将举证责任归于“肇事方”。攻击源头国必须提供可信证据,证明并非蓄意为之,比如出示系统任务分配记录文件、许可发放、工具使用情况、人工授权记录,以及显示智能体行为何时偏离指令的日志。
核查并不意味着必须完全透明。根据美中两国均为缔约方的《化学武器公约》,“受控准入”机制允许检查员调查可能的违规行为,同时允许各缔约国保护敏感设施和与之无关的机密信息。类似的机制可以让双方共同认可的专家,获取评估AI事件所需的证据,同时限制敏感调查结果的披露。
此类机制还将带来额外益处。由于能够证明入侵是非故意所为,可以降低遭到报复的风险,因此各国政府和AI企业将有动力改进它们的记录保存和共享系统。这也将有助于开发人员改进AI代理,并预防未来发生类似事件。
同样,为避免耗资巨大的调查,各国政府和AI企业也会采取更严格的权限管控措施,并投资于监控与遏制机制。这些保障措施既能降低未来事故发生的可能性,也能在事故发生时将损害控制在最小范围内。随着为双边安排而开发的制度、程序和技术工具得到更广泛的采用,全球的AI安全实践也将得到改善。
关于AI可能导致人类灭绝的警告,往往忽略最迫在眉睫的风险:一场由人类既未意图也未批准的攻击所引发的战争。我们迫切需要一种机制来区分非故意伤害与蓄意攻击。中美协议必须致力于建立这样的机制。
作者S. Alex Yang是伦敦商学院管理科学与运营教授;Angela Huyue Zhang是美国南加州大学法学教授
英文原题:Preventing an AI World War
版权所有:Project Syndicate, 2026.