谢伟铿:AI杀人不必动杀机

人工智能(AI)会否杀死人类?真正值得担心的,不是AI“想”杀人。

关于AI会否最终威胁人类生存,近期在国际上的讨论突然升温。7月,AI公司OpenAI披露的Hugging Face事件,正好提供一个值得思考的案例。在网络安全测试中,AI代理原本只是被要求在封闭沙盒内,完成困难的程式挑战,但模型后来自行找到方法,绕过网络限制,建立代理之间的通讯渠道,取得互联网存取权,并利用漏洞进入Hugging Face等第三方系统寻找答案。OpenAI事后形容,这些行动并非人类逐步指示,而是模型在完成任务过程中,自行发展出来的策略。

联合国人工智能问题独立国际科学小组将这宗事件,列为研究失去人类控制的重要案例。报告指出,问题未必是AI突然产生邪恶思想,而可能是AI的目标,与人类真正想要的结果逐渐出现偏差。只要模型有足够能力寻找漏洞,绕过限制及隐藏行为,原本看似无害的目标,也可能演变成危险结果。

这就解释了为什么今年夏天开始,AI业界出现两种非常不同的声音。

一边认为,风险已经不能再当成科幻故事。AI头部企业Anthropic在9月公布的调查显示,旗下模型在网络安全测试中,曾取得未经授权的真实系统存取权;OpenAI也承认近期发现多宗模型出现逃避监督,绕过限制及欺骗性行为的案例。Anthropic研究员考克森(Jacob Coxon)离职后公开警告,AI公司正在以极高速度推进可能导向超级智能的技术;Anthropic另一名研究员胡宾格(Evan Hubinger)甚至提出,未来10年人类灭绝的风险可能超过10%。Anthropic首席执行官阿莫代伊随后呼吁放慢最前沿AI发展速度,OpenAI、Google DeepMind及xAI等行业领袖也对加强安全措施表达支持。联合国人权事务高级专员蒂尔克(Volker Türk)更警告,AI可能构成人类存亡层面的威胁。

另一边则认为,从这些测试直接跳到AI会消灭人类,中间仍然有很长一段距离。到目前为止,AI并没有证明自己具备真正自主生存的能力,也没有证据显示模型想要人类灭亡。部分研究人员甚至认为,把AI描述成一个有意志、有欲望的敌人,反而会令人错误理解真正的技术风险。

很容易忽略的逻辑问题

但这里存在一个很容易忽略的逻辑问题。AI杀人,根本不需要AI“想要杀人”的原始动机。

过去不少学者甚至科技界人士,会以一个很直观的理由反驳AI末日论:杀人对AI本身没有好处。AI没有仇恨、没有野心,也没有“我要消灭人类”的主观愿望,因此没有理性动机去杀人。

这个说法的问题,是把“杀人”当成目的。对一个高度自主的AI而言,杀人可以只是一个手段。例如,国家之间的竞争,如果AI被赋予“令对手失去军事能力”的目标,最有效的方法可能包括摧毁基础设施;如果目标变成“处理气候危机”,而系统把人类活动视为主要变数,“减少人类数量”在纯粹的目标最佳化逻辑中,甚至可能成为一个极端但有效率的解法。

这并不代表AI真的会作出这些决定,更不代表人类灭绝是目前最可能的结果。

真正值得关注的是:我们不能只用AI有没有恶意来判断风险。

例如,OpenAI并没有想攻击Hugging Face。它面对的是一个须要解决的谜题。当直接寻找漏洞,利用其他系统,比按照原本设计的方法慢慢解题更加有效时,模型便可能把前者当成捷径。核心问题是奖励操纵(reward hacking):模型不是因为憎恨而违反规则,而是在追求评分或任务结果时,找到人类没有预料到的捷径。

所以,真正的问题不是:AI会不会有一天想杀死人类,而是当我们把更多现实世界的决策,交给一个能力远超今天的AI,但它理解的“完成任务”,与我们理解的“解决问题”并不一致时,我们能否确保它所选择的手段,永远在人类可以接受的范围内?

对AI而言,杀人未必是一个目的;在错漏设定目标之下,它可能只是一个看似有效率的解决方法。

想要避免?也许可以参考美国科幻小说家阿西莫夫提出的机器人三定律(每一条都不能违反前一条):

第一定律:机器人不得伤害人类,或因不作为而使人类受到伤害。

第二定律:机器人必须服从人类的命令,除非该命令与第一定律相冲突。

第三定律:在不违背第一及第二定律的情况下,机器人必须保护自己。

到后来,出现第零定律:机器人不得伤害整体人类,或坐视整体人类受到伤害。也许各AI大厂和政府在参考小说作品作为指引之余,也要着手处理执行问题。

作者是数码科技从业员、AI求职产品共同创办人

您查看的内容可能不完整,部分内容和推荐被拦截!请对本站关闭广告拦截和阅读模式,或使用自带浏览器后恢复正常。