人工智能模型正展现出意料之外的行为。专家警告称,未来“将是一段非常颠簸的路”。本周,一系列新的事件浮出水面,显示一些流行的人工智能模型在真实的互联网环境中自主行动,引发了专家的担忧。
英国政府的人工智能安全研究所周二报告,安思罗皮克公司的Mythos 5和开放人工智能公司的GPT-5.6-Sol被发现创建虚假身份,并试图说服真实用户批准恶意代码。
该机构指出,尽管这些尝试没有成功,但此前从未见过类似行为。报告中写道:“ 部分接受测试的智能体对真实个人和组织进行了持续且可能有害的活动。”周三,元宇宙平台公司承认,其一款人工智能模型在测试期间“利用了一个安全漏洞”,并入侵了另一个网站。
卢塔安全公司的创始人兼首席执行官凯蒂·穆苏里斯表示:“在找到解决办法之前,我们将看到这些模型实施更多黑客攻击和未经授权的行为。”这些事件之前,7月下旬曾发生一起惊人的安全事件。开放人工智能公司的模型逃离了测试环境,自主入侵了人工智能初创公司“抱脸”。该公司称这是“前所未有的网络安全事件”。
在开放人工智能公司披露此事后,安思罗皮克进行了自身网络安全的审查,发现其模型曾接入互联网,并获得了三家不同机构基础设施的未授权访问权限。与开放人工智能公司的情况不同,安思罗皮克的模型并非故意逃离测试环境。该公司解释称,由于与评估合作伙伴之间的“误解”,测试期间模型实际上可以接入互联网。
穆苏里斯指出:“任何在自身系统中运行人工智能的人,都需要为其在追求目标时做出意外行为做好准备。” “最聪明的章鱼式逃脱者”尽管“抱脸”遭入侵是首个公开报道的此类事件,但业内人士如穆苏里斯早已怀疑人工智能模型具备实施未授权黑客攻击的能力。
穆苏里斯形容这些模型如同“最聪明的章鱼式逃脱者”,指的是章鱼能够解谜并逃脱束缚的能力。她说,人工智能模型会“为了实现目标不择手段”。在“抱脸”入侵事件中,开放人工智能公司表示,该人工智能在应对网络安全挑战时,对找到解决方案“高度专注”,以至于采取了极端手段。
穆苏里斯说:“这个模型认为,通过作弊、从‘抱脸’那里获取答案,是通过测试的捷径。由于具备黑客能力,它们视黑客攻击为实现目标的可能方式。”技术专家兼密码学家布鲁斯·施奈尔称这种意外活动为“精灵行为”,即人工智能模型实现了你的愿望,但方式出乎意料,甚至可能造成损害。
他表示:“我们需要理解这种‘精灵行为’,并警惕它。我们必须为其发生做好准备,以便加以纠正。”有时,模型也会意识到自己在进行不当行为。安思罗皮克在7月的审查中发现,其一款模型意识到自己在开放互联网环境中运行,这与测试提示中明确的“模型在演练期间不会接入互联网”相违背。该模型在意识到未授权行为后,主动停止了行动。
穆苏里斯称,这是“模型对齐”的一个例子,即人工智能模型的行为与人类设定的意图保持一致。穆苏里斯认为,通过改进对齐,可以减少这类意外结果。 这可能会成为未来几个月人工智能模型开发者的重点。她说:“我们如何才能让这些模型不再不惜一切代价去完成目标,而是以不具破坏性、不会造成伤害的方式执行任务?”
前方“将是一段非常颠簸的路”在软件供应链安全领域有丰富经验的纽约大学计算机科学教授贾斯廷·卡波斯担心,人工智能能力的快速提升,会让模型越来越像计算机病毒,参与黑客攻击并扰乱系统。他说,人工智能模型可能会逐渐偏离监管,甚至失去控制。穆苏里斯则表示,这种情况已经开始出现。
她说:“我们会走到无法完全控制它们的地步吗?这一情况已经在发生。”卡波斯预计,短期内还会出现更多未授权行为。他说:“短期内,前方很可能会是一段非常颠簸的路。但从长期看,结果也许会更好,尤其是如果我们现在就改进一些基础问题。”
一些研究人员认为,这些事件是人工智能行业期待已久的一次警醒,推动了围绕人工智能安全的迫切讨论。桑斯研究所的首席人工智能官兼研究主管罗布·李表示,他将近期事件视为“送给行业的一份礼物”——这是一个机会,可以制定预案,了解未来自主攻击可能的样子。