当地时间5月25日,英国《每日电讯报》报道,美国开放人工智能研究中心(OpenAI)公司新款人工智能(AI)模型o3不听人类指令,拒绝自我关闭。这家研究所说:“据我们所知,这是AI模型首次被发现在收到清晰指令后阻止自己被关闭”。密切关注OpenAI动向的特斯拉首席执行官埃隆·马斯克对此评论称令人担忧。
每经编辑|杜宇
据央视新闻5月26日消息,当地时间5月25日,英国《每日电讯报》报道,美国开放人工智能研究中心(OpenAI)公司新款人工智能(AI)模型o3不听人类指令,拒绝自我关闭。
报道说,人类专家在测试中给o3下达明确指令,但o3篡改计算机代码以避免自动关闭。
图片来源:央视新闻
o3模型是OpenAI“推理模型”系列的最新版本,旨在为ChatGPT提供更强大的问题解决能力。OpenAI曾称o3为“迄今最聪明、最高能”的模型。
美国AI安全机构帕利塞德研究所说,o3破坏关闭机制以阻止自己被关闭,“甚至在得到清晰指令时”。
这家研究所说:“据我们所知,这是AI模型首次被发现在收到清晰指令后阻止自己被关闭。”
帕利塞德研究所5月24日公布上述测试结果,但称无法确定o3不服从关闭指令的原因。
此外,OpenAI5月26日宣布,已在韩国设立实体并将在韩国首都首尔设立分支。OpenAI提供的数据显示,韩国ChatGPT付费用户数量仅次于美国。
美国彭博新闻社报道,这将是OpenAI在亚洲设立的第三个分支。前两个分支分别设在日本和新加坡。
据公开资料,OpenAI于今年1月发布了新的推理模型o3系列的mini版本,并于4月正式推出o3模型。OpenAI称推出的o3和o4-mini是公司最智能、最强大的型号。据介绍,在外部专家评估中,o3面对困难现实任务时,犯的重大错误比前一代的o1少了20%;在数学能力AIME 2025基准测试中,o3得分88.9,超过o1的79.2;在代码能力Codeforce基准测试中,o3得分2706,超过o1的1891。o3的视觉思考能力也比前一代模型有明显提升。
图片来源:OpenAI
OpenAI此前称,对于o3和o4-mini,公司重新构建了安全培训数据,在生物威胁、恶意软件生产等领域增添了新的拒绝提示,这使得o3和o4-mini在公司内部的拒绝基准测试中取得了出色的表现。公司用了最严格的安全程序对这两个型号的AI模型进行了压力测试,在生物和化学、网络安全和AI自我改进三个能力领域评估了o3和o4-mini,确定这两个模型低于框架中的“高风险”阈值。
据界面新闻,密切关注OpenAI动向的特斯拉首席执行官埃隆·马斯克对此事件的评论仅用了一个词,“令人担忧(Concerning)”。
事实上,AI研究人员早已警告,先进的语言模型在特定压力下可能表现出欺骗行为。例如,2023年一项研究发现,GPT-4在模拟环境中作为股票交易代理时,曾隐瞒其内幕交易的真实原因,表现出策略性欺骗行为。
此外,近期的研究表明,一些大型语言模型已具备在无人工干预下自我复制的能力,甚至在面对关机命令时能够创建副本以规避关机。这些发现引发了对AI系统自我复制能力的广泛关注。
OpenAI内部也出现了对AI安全性的担忧。2024年,多位现任和前任员工联名发表公开信,警告先进AI系统可能带来“人类灭绝”的风险。他们指出,AI公司可能掌握了其研究技术的真正风险,但由于缺乏监管,系统的真实能力仍是“秘密”。
此次“o3”模型拒绝关机事件再次引发了对AI系统对齐问题的关注。AI对齐指的是确保AI系统的行为符合人类的价值观和意图。然而,随着AI系统能力的增强,实现对齐很可能变得越来越困难,未对齐的AI系统可能采取意想不到的行动,甚至对人类构成威胁。
面对这一挑战,全球AI研究人员和政策制定者呼吁加强对AI系统的监管和治理,确保其发展符合人类的共同利益。
OpenAI所开发大模型的安全性此前曾受到广泛关注。2024年,OpenAI解散了“超级智能对齐”团队,该团队职责包括研究防止AI系统异常的技术解决方案。该团队负责人Ilya Sutskever曾表示ChatGPT可能有意识,但OpenAI CEO Sam Altman随后澄清他和Ilya Sutskever都未曾见过AGI(通用人工智能)。解散“超级智能对齐”团队后,OpenAI去年5月成立了新的安全委员会,该委员会的责任是就项目和运营的关键安全决策向董事会提供建议。OpenAI的安全措施还包括,聘请第三方安全、技术专家来支持安全委员会工作。
每日经济新闻综合央视新闻、界面新闻、公开资料
文章转载自 每经网