ASU 魏华:大模型智能体正在重蹈强化学习的覆辙,如何跨越「仿真到现实」的鸿沟? | IJCAI 2026
创始人
2026-08-21 13:24:13
0

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:雷峰网)

当大语言模型化身为智能体走向真实世界,它们面临的困境,与十年前在十字路口指挥交通的强化学习模型如出一辙。 作者丨岑峰幸丽娟

编辑丨岑峰

在通往 AGI 的浪潮中,基础模型智能体(Foundation Model Agents)正以前所未有的速度接管各种任务。业界曾普遍乐观地认为,凭借大模型海量的预训练知识,智能体可以无缝适应各种真实场景。

但在现实中,当我们将一个在英文语境下表现完美的智能体,切换到中文或低资源语言环境中时,其错误率往往会呈现断崖式上升。

这种环境切换带来的“智力降级”,真的是大模型时代特有的新问题吗?

在正在进行的 2026 年的德国不莱梅 IJCAI大会的 Early Career Spotlight(早期职业焦点)环节,亚利桑那州立大学(ASU)助理教授魏华给出了一个极具启发性的“降维”视角:今天大模型智能体所面临的脆弱性,本质上与传统强化学习(RL)在物理世界中遭遇的“仿真到现实(Sim-to-Real)”差距如出一辙。

作为长期深耕强化学习与真实世界决策的学者,魏华教授早年曾在腾讯 AI Lab 担任研究员,后于新泽西理工学院和 ASU 任教。早在2017 年,魏华团队就通过一系列 KDD论文证明了强化学习能够完美复现传统的“绿波”优化解,甚至能找到更优的调度策略。

但随着研究从实验室走向中国杭州等真实复杂路网,他发现,完美的模拟器是不存在的。天气、摄像头视角、甚至奖励函数的定义,在真实世界中都存在着致命的偏差。实验室中取得的完美结果一旦部署到真实的街头,面对大雨、大雾以及穿行的行人,AI 的决策就会瞬间崩溃。

在此次 IJCAI 的演讲中,魏华巧妙地将“交通信号灯”与“大语言模型”连接了起来。他指出,无论是机器人、强化学习还是今天的大模型智能体,只要涉及决策与执行,就必然面临动态差距、观察差距和奖励差距。

更为重要的是,他提出,既然问题的本质相同,我们完全可以将机器人领域成熟的“域随机化(Domain Randomization)”等技术,直接“平移”到大模型智能体中。最新的实验证明,通过对智能体的提示词、动作和奖励空间进行随机化扰动,一个仅 30 亿参数(3B)的模型,在应对跨语言等“仿真到现实”难题时,其表现甚至能击败 320 亿参数(32B)的庞然大物。

此外,魏华强调了“不确定性量化”与“人类在环(Human-in-the-loop)”的终极价值:智能体可以无限扩展,但不能增加人类的监督负担。机器必须知道自己“何时不知道”,并精准地向人类求助。

以下是魏华教授的演讲分享,演讲题目为《Towards Reliable Agents》。AI科技评论根据其英文演讲内容进行了不改原意的深度编辑与精简:

▎Towards Reliable Agents(迈向可靠智能体)

演讲者: 亚利桑那州立大学助理教授 魏华(Hua Wei)

大家好。我是亚利桑那州立大学计算与人工智能学院的助理教授魏华。非常荣幸能来到 IJCAI的讲台,分享我过去研究的一些反思,探讨我们曾尝试的不同视角,以及对未来工作的展望。

我们团队一直以来的一个核心命题是:我们能否为现实世界的复杂决策,构建真正可靠的智能体(Agents)?

01

完美的模拟器,与混乱的物理世界

为了说明这个问题,我们回到 2017 年,从我最初研究的“交通信号控制强化学习”说起。我们希望通过协调城市里的每一个交通信号灯,让所有车辆都能更顺畅地通行,并将其部署到物理世界中。

这一时期,我们做了一些关于多智能体系统和“仿真到现实(sim-to-real)”迁移的研究。以交通信号控制为例,在交通信号控制的强化学习中,智能体的“状态”是路口的排队车辆数,“动作”是切换红绿灯,“奖励”则是最小化所有车辆的通行时间。

在 2018 年和 2019 年的 KDD 论文中[1,2],我们证明了强化学习确实能学到与传统运筹优化相同的最优解,比如著名的“绿波”效应(让车辆一路绿灯畅行),而且它能更好地适应非匀速的真实车流。

然而,当我们试图把在模拟器里训练得炉火纯青的算法拿去现实中部署时(例如在中国杭州的真实复杂路网),问题出现了。在模拟器中,汽车的驾驶行为高度规律,但在现实世界,每个交通参与者都有自己的目的,路况瞬息万变,根本不存在一个能完美拟合真实物理世界的模拟器。

这就是我们所说的“仿真到现实(Sim-to-Real)”差距。基于这种惨痛的现实认知,我们开始深入研究 Sim-to-Real的迁移问题。我们的目标是让模型在模拟环境中的表现与在真实世界中的表现无限趋近,让差距(Gap)接近于零。

在研究中[3],我们将这种复杂的现实鸿沟系统性地拆解为了五个子维度:观察差距(Observation Gaps)、状态差距(State Gaps)、动作差距(Action Gaps)、动态差距(Dynamics Gaps)以及奖励差距(Reward Gaps)。

例如动态差距,在模拟器中,如果变绿灯,我们假设所有车都会顺利通过。但如果在真实的雨天、雾天或雪天,车辆行驶缓慢,同样的绿灯时长,可能只有两辆车通过,剩下一辆被堵在路口。这意味着:相同的状态和动作,在虚实两个世界中会导致完全不同的下一个状态。

随着时间的推移,这种偏差(Drift)会像滚雪球一样越来越大。在 AAAI 2024的工作[4]中,我们尝试将天气等背景信息作为条件输入来缩小这种差距,但仍无法做到完美。

还有观察差距,在训练中,摄像头视野清晰;但在雾天、雪天或黑夜,传感器捕捉到的画面会大打折扣[5]。模型如何能保证在完美视觉下训练的策略,在恶劣天气或夜间依然鲁棒?

以及奖励差距,在模拟器里,我们的唯一目标是最小化汽车的通行时间。但在真实世界中,你不能只看汽车,还要考虑行人的安全和通行效率。一旦引入真实约束,你原本设定的完美奖励函数就会发生剧变,目标函数的错位,会导致智能体做出危险决策。

02

大模型智能体,正在重蹈覆辙

刚才我们谈论的是传统强化学习,但我们惊讶地发现:如今备受追捧的基础模型智能体,正在面临完全相同的挑战,只是人们换了一套术语。

以大模型的多语言能力为例,如果用英语向大模型提问,它表现得完美无瑕;但如果切换到中文、德语甚至一些低资源语言,它的错误率就会出现断崖式上升。在自然语言处理(NLP)领域,大家管这叫多语言泛化难题。

但在上周的 KDD 大会上[6],我们提出:基础模型智能体中的可靠性问题,本质上就是一个标准的“仿真到现实”问题

如果把每种语言看作一种“模态”,模型的训练数据主要是一种模态(英语语境,相当于“模拟器”),而它的测试环境是另一种模态(其他语言,相当于“复杂的真实世界”)。这就完美对应了我们刚才提到的“观察差距”。

既然问题的本质相通,我们完全可以从成熟的强化学习或机器人领域“借用”破局思路。

03

用“域随机化”为大模型降维解局

在机器人控制中,为了弥补模拟器与现实的差距,我们常用一种叫“域随机化(Domain Randomization)”的技术:在训练时人为地对输入的文本、标题、描述甚至动作和奖励空间进行随机化扰动。以提升模型在真实世界中的鲁棒性。

我们将这一理念直接引入到了大语言模型智能体中,在测试大模型时,我们对其输入的文本、提示词、参数描述甚至它所面临的动作与奖励空间,进行大规模的“随机化重写与扰动”[7,8]。结果令人极其振奋:一个仅仅 30 亿(3B)参数的小模型,在经过域随机化处理后,其应对跨环境差距的表现几乎接近完美,甚至击败了规模大十倍的 320 亿(32B)参数的最佳模型。

这说明,机器人领域历经检验的“抗干扰”哲学,在今天的大模型智能体时代依然是大杀器。动作、奖励、转换等维度的差距,是所有决策智能体共通的顽疾。

04

随机化与“不确定性量化”的安全底线

最后,我想谈谈我个人目前极其兴奋的研究方向:不确定性量化(Uncertainty Quantification)。在试图弥合虚实鸿沟的所有方案中,我们必须承认一个现实:我们可能永远无法做到完美的闭环。

面对充满未知的真实世界,如果我们想要保证智能体在真实世界中不出致命错误,最终极的防线始终是“人类在环(Human-in-the-loop)”。机器必须知道自己“什么时候不确定”,知道何时该自主决断,何时必须呼叫人类支援,在关键时刻将决策权交给人类。

▎为此,我们为大模型定义了四个层级的不确定性量化[9]:

1.答案本身是否值得信任?

2.模型的推理逻辑是否脆弱?

3.能否精确定位是哪一步推理犯了错?

4.该智能体的认知是否与其他模型/系统对齐?

总结而言,我们认为“仿真到现实”的差距广泛存在于机器人学、强化学习、真实世界以及基础模型智能体等大多数决策场景中。我们呼吁上述领域的学者建立一套共通的底层词汇与评估标准,我们就可以测试并且共享相同的技术。

在未来,智能体可以无限制地扩大规模、接管更多的任务,但人类的监督负担绝不能随之呈指数级加重。让机器学会在不确定时求助,把最关键的问题留给人类,才是 AI 走向真实世界的最优解。

以上是我的演讲。如果你们对这一话题感兴趣,欢迎在微信、LinkedIn以及我的播客上[10]进一步交流。

[1] Hua Wei, Guanjie Zheng, Huaxiu Yao and Zhenhui Li. IntelliLight: A ReinforcementLearning Approach for Intelligent Traffic Light Control. In Proceedings of the 24th ACMSIGKDD International Conference on Knowledge Discovery and Data Mining (KDD2018).

[2] Hua Wei, Chacha Chen, Guanjie Zheng, Kan Wu, Vikash V. Gayah, Kai Xu andZhenhui Li. PressLight: Learning Max Pressure Control to Coordinate Traffic Signals inArterial Network. In Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD 2019).

[3] Longchao Da, Justin Turnau, Thirulogasankar Pranav Kutralingam, AlvaroVelasquez, Paulo Shakarian, Hua Wei. A Survey of Sim-to-Real Methods in RL:Progress,ProspectsandChallengeswithFoundationModels.https://arxiv.org/abs/2502.13187

[4] Longchao Da, Minchiuan Gao, Hao Mei, Hua Wei. 2024. Prompt to transfer:Sim-to-real Transfer for Traffic Signal Control with Prompt Learning. In Proceedings of the Thirty-Eighth AAAl Conference on Artificial Intelligence (AAAl'24).

[5] Tiejin Chen, Prithvi Parag Shirke, Bharatesh Chakravarthi, Arpitsinh RohitkumarVaghela, Longchao Da, Duo Lu, Yezhou Yang, Hua Wei. SynTraC: A Synthetic Datasetfor Traffic Signal Control from Traffic Monitoring Cameras. In Proceedings of 27th IEEE International Conference on Intelligent Transportation Systems (ITSC'24).

[6] Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei. The Sim-to-Real Gap ofFoundation Model Agents: A Unified MDP Perspective. In the Proceedings of the 32nd

SIGKDD Conference on Knowledge Discovery and Data Mining (KDD'26).

[7] Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng GaoHaiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu,Ryan A Rossi, Hua Wei, Xiyang Hu. When Simulation Lies: A Sim-to-Real BenchmarkDomain-RandomizedRLTool-UseandRecipeforAgents

https://arxiv.org/abs/2605.11928

[8] Xiaoou Liu, Longchao Da, Hanyang Chen, Yuan Ling, Hua Wei. AndroidReality:How Far Are Mobile Agents from the Real World? https://arxiv.org/abs/2608.07775

[9] Xiaoou Liu, Tiejin Chen, Longchao Da, Chacha Chen, Zhen Lin, Hua Wei.

Uncertainty Quantification and Confidence Calibration in Large Language Models: ASurvey. In the Proceedings of the 31st ACM SIGKDD International Conference on

Knowledge Discovery and Data Mining (KDD'25).

[10]播客:华几来了 https://linktr.ee/huajilaile

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」?

? 进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

相关内容

热门资讯

长征五号B遥一运载火箭顺利通过... 2020年1月19日,长征五号B遥一运载火箭顺利通过了航天科技集团有限公司在北京组织的出厂评审。目前...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
湖北省黄冈市人大常委会原党组成... 据湖北省纪委监委消息:经湖北省纪委监委审查调查,黄冈市人大常委会原党组成员、副主任吴美景丧失理想信念...
《大江大河2》剧组暂停拍摄工作... 搜狐娱乐讯 今天下午,《大江大河2》剧组发布公告,称当前防控疫情是重中之重的任务,为了避免剧组工作人...