炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
你有没有想过一个问题:一个正在做题的学生,如果卡住了去请教老师,老师给出的建议应该是什么样的?
假设这个老师从来没见过这个学生做错题的样子,只是照着标准答案给建议,那这个建议大概率是正确的废话——正确,但用不上。真正有用的老师,是那种见过你这道题怎么错的、知道你卡在哪一步的人。
这个问题放到人工智能领域,变成了一件挺有意思的事。现在很多搜索智能体在回答复杂问题时,会像人一样上网查资料、多轮检索、逐步推理。但这些智能体一旦在中途走偏了,往往要等到最后交卷才知道自己错了。这篇来自复旦大学和腾讯的论文,就是在琢磨怎么给这些智能体配一个"当场纠错"的老师,而且这个老师还得随着学生一起成长。
**搜索智能体最大的软肋:错误只能秋后算账**
先说说现在的搜索智能体是怎么工作的。
大语言模型智能体:能够自主决策、调用外部工具(比如搜索引擎)来完成复杂任务的AI系统,区别于只能被动回答问题的普通聊天机器人
早期的检索增强生成方法,要么是死板地规定"每隔几步就去查一次资料",要么是设了个触发条件,条件满足了才搜索。这些方法说白了都是"死规矩",不聪明。后来出现了一批用强化学习训练出来的搜索智能体,它们能自己学会什么时候该搜、该搜什么,靠的是任务完成后给的一个终局奖励——答对了给分,答错了不给分。
强化学习:一种机器学习方法,通过让智能体不断尝试、根据结果反馈(奖励)调整策略,最终学会完成任务的最优路径
这套办法听起来挺好,智能体自己摸索出了搜索策略。但问题也出在这里:终局奖励只能告诉你"这盘棋你输了",却说不出"你在第几步走错了"。
想象你在开车去一个陌生的地方,导航一路没有任何提示,只有到了终点才告诉你"到错地方了"。这时候你根本不知道是十公里前那个路口拐错了,还是刚才那个岔路选错了方向。你只能从头再走一遍,而且下次遇到类似的路口,你还是不知道该怎么选,因为你压根不知道上次错在哪个具体的转弯。如果导航能在你刚拐错弯的那一刻就提醒你"这个路口不对,应该往右",你才能真正学会怎么走这条路。
这就是搜索智能体面临的真实困境。论文里举了几个很具体的例子:智能体可能一开始给自己定了个限制条件,查着查着就把这个条件忘了;或者应该去查一个关键的子问题,结果压根没去查;又或者反复换着说法重新提问,却始终没有获得任何新信息。这些错误往往发生在轨迹的中段,而不是开头或结尾,等到最后答案错了才回头看,已经说不清到底是哪一步埋下的祸根。
近些年也有研究开始尝试给更细粒度的反馈,比如通过信息增益、置信度变化、局部状态对比这些方式来评估中间步骤的好坏。但这类方法本质上还是"事后打分",它评判这一步走得好不好,却不会在当下告诉智能体"接下来该怎么走"。真正能改变正在进行的轨迹的,是那种能实时诊断问题、给出具体下一步建议的反馈,而不是打分。
**给智能体配一个反馈机制,难在哪里**
那能不能直接给智能体加一个反馈环节呢?之前确实有人这么试过,像Reflexion、Self-Refine这些方法,都是让模型在推理过程中生成一些自然语言的反思或批评。
但这些方法有个共同的特点:反馈都是靠提示词临时诱导出来的,反馈本身并没有经过专门训练,而且大多是在任务彻底结束之后才进行反思,没法在轨迹进行到一半时就介入纠正。
如果真要做一个能实时介入、而且反馈本身也是训练出来的机制,会遇到三个纠缠在一起的难题。
第一个难题出在智能体自己身上。智能体得学会什么时候该喊"我需要帮助",可这里有个很微妙的地方:一个被反馈救回来的轨迹,和一个从头到尾都顺风顺水的轨迹,最后拿到的奖励是一样的。那问题来了,这个奖励到底应该表扬前面走错的那部分,还是表扬后面被纠正过来的那部分?这就好比一个学生考试时蒙对了一道题和真正会做拿到的分数是一样的,但显然这两种情况背后的能力是不一样的,如果奖励机制分不清这一点,智能体可能会学到错误的经验。
第二个难题出在给反馈的"老师"这一边。这个老师给出的反馈质量好不好,是没有标准答案的,只能靠最终任务是否成功来倒推。但最终成功与否,既取决于反馈之前的搜索走了什么路,也取决于反馈之后智能体又做了什么选择,反馈本身的贡献被淹没在这一长串因果链里,很难单独拎出来评价。
第三个难题出在两者之间的动态关系上。智能体在训练过程中会不断进化,它访问的状态、犯的错误类型都会跟着变。如果反馈机制是训练一次就固定不变的,那随着智能体越来越聪明,它犯的错误也会越来越"高级",这个一成不变的老师很快就会跟不上学生的进步,给出的建议越来越文不对题。
**CAFE的解法:让同一个模型既当学生又当老师,还得两个身份轮流升级**
面对这三个难题,论文提出了一个叫CAFE(Coupled Agent-Feedback Evolution,耦合的智能体-反馈协同进化)的框架。
它的核心思路说起来不复杂:用同一个模型,分饰两个角色——一个是负责搜索答题的"智能体",一个是负责挑错纠偏的"评论者"。这两个角色共享同一套参数,只是在不同时刻扮演不同的身份。当智能体在搜索过程中喊出"请求反馈"的指令时,这个模型就切换到评论者身份,看着当前的搜索记录,给出具体的诊断和建议,然后再切回智能体身份,带着这条建议继续往下走。
角色条件化:用同一个模型的不同"人格模式"分别执行不同任务,而不是训练两个独立的模型,这样能节省大量计算资源,同时保证两个角色对同一套知识和上下文有一致的理解
这就像一个既会做菜又懂点评的人,在自己炒菜炒到一半突然愣住的时候,能够抽身出来用挑剔的眼光审视一下锅里正在发生的事情,然后再重新拿起锅铲。如果换成两个完全独立的人——一个只会做菜、一个只会点评——那点评者可能压根不了解这道菜此刻火候到了哪一步、食材放了多少,给出的建议自然也隔靴搔痒。共享参数的设计,本质上是让"挑错的能力"和"做事的能力"共用同一套对世界的理解。
这个框架分成两个阶段来训练。
第一阶段是打基础,论文管这个叫"自我反馈搜索智能体"的初始化。具体做法挺巧妙:先收集基础模型自己搜索失败的案例,然后请一个更强的教师模型(论文里用的是Kimi-K2.5)去分析,找出这条失败轨迹里最早开始出错的那个节骨眼。接着,保留智能体自己生成的、在出错之前的那部分内容,在出错的地方插入一个"请求反馈"的动作,再让教师模型生成对应的反馈内容和后续的正确操作。最后只保留那些真正被纠正回正确答案的轨迹,用这些数据来做监督微调。
监督微调:用人工准备好的标准数据,让模型模仿这些数据里的行为模式,是训练模型的一种基础方式,区别于让模型自己摸索的强化学习
这里有个细节值得多说两句:论文特意强调,这批数据保留的是智能体自己真实犯过的错误,而不是让教师模型从头到尾编一个完美的示范轨迹。原因很简单,如果全用教师模型自己生成的完美案例来教,那智能体学到的可能是教师模型的思维习惯,而不是"怎么从自己容易犯的错误里走出来"。这就好比教一个左撇子写字,如果全靠观摩右撇子的示范,他学到的姿势可能永远别扭;真正管用的教学,是先看他自己左手写歪的样子,再在这个基础上一点点纠正。
**第二阶段:在线学会"何时求助",离线学会"怎么给建议"**
打好基础之后,进入正式的训练循环,这也是整篇论文最核心的部分。这个循环分成在线和离线两条线,交替进行。
在线这条线,教智能体学会两件事:什么时候该请求反馈,以及请求反馈之后该怎么把这份反馈用好。这里用到了两个技术手段。
第一个叫比较式反馈估计(Comparative Feedback Estimate, 简称CFE)。具体做法是,针对同一个问题,采样一批(论文里是8条)不同的搜索轨迹,把这批轨迹分成两组:一组在搜索过程中请求了反馈,另一组没有请求。然后计算这两组各自的成功率,算出一个差值。如果请求反馈的那组成功率明显更高,说明这次请求反馈是值得的,这个差值就会被加到对应轨迹的奖励里;反过来如果请求反馈也没帮上什么忙,这个加分就很小甚至没有。同时,为了防止智能体学会"逢事就求助"这种偷懒行为,论文还加了一个惩罚项,只要请求反馈的次数超过一次,就要扣分。
这套机制说白了,就是把"这次求助到底值不值"这件事,用同一批问题下不同做法的对比结果给量化出来了。这有点像一个班级里,老师想知道某个学生在考试时翻书查资料到底有没有用,与其单看这个学生自己的成绩,不如把全班同学分成查资料和不查资料两拨,对比一下两拨人的平均分差距——如果查资料这拨明显考得更好,说明查资料这个动作本身是有价值的,应该被鼓励。如果不做这个分组对比,直接凭一个学生自己的分数去判断查资料好不好,那根本说不清楚这个学生考得好到底是因为查了资料,还是他本来就厉害。
第二个手段叫反馈感知的优势重塑(Feedback-Aware Advantage Shaping)。这一步要解决前面提到的那个棘手问题:一条被反馈救回来的轨迹里,请求反馈之前的那部分内容(往往已经是走偏的行为)和请求反馈之后的那部分内容(往往是被纠正回来的正确行为),不应该被同等对待。
优势(Advantage):强化学习里用来衡量某个具体动作比"平均水平"好多少或差多少的一个数值,数值越高说明这个动作越值得被强化
论文的做法是把每条请求了反馈的轨迹,按第一次请求反馈的位置切成三段:请求之前、请求本身、请求之后。然后对请求之前的部分,适当降低它获得的奖励权重(甚至压到零,因为这部分往往是导致出错的行为);对请求之后的部分,适当提高奖励权重(因为这部分是真正带来成功的行为)。这样一来,同一条成功轨迹里,"走错的部分"和"纠正回来的部分"就不会被混为一谈、一起邀功了。
这个设计的必要性,可以拿一个类似"团队复盘"的场景来理解。假设一个项目组临时救场把一个濒临失败的项目拉了回来,如果复盘时把功劳记在整个团队头上,那些一开始就把项目搞砸的人,和后来临危受命力挽狂澜的人,拿到的表彰是一样的。这样的复盘方式,会让那些制造麻烦的人误以为自己做得没问题,反正最后结果是好的。真正公平且有效的复盘,应该把"制造问题"和"解决问题"分开记账,只有这样,团队才能学到"以后别再犯那个错",而不是学到"反正出了问题也有人兜底"。
**离线这条线:怎么教会评论者给出真正有用的建议**
在线优化解决的是智能体"什么时候求助、怎么用好反馈"的问题,但反馈内容本身的质量,还得靠另一条线来打磨,这就是论文提出的第二个核心技术:基于轨迹的偏好优化(Rollout-Derived Preference Optimization,简称RDPO)。
这里的难点在于,环境只会给最终答案打分,没法直接告诉你"这条反馈写得好不好"。一条反馈是否有用,混杂在它前面的搜索过程和它后面的具体操作里,很难单独拆解出来。
论文的解决办法是构造"配对偏好数据"。具体来说,在每一轮训练迭代中,把最新一批轨迹按问题分组,在同一个问题下,找出一条请求了反馈且最终成功的轨迹,再配上一条请求了反馈但最终失败的轨迹。经过筛选,只保留那些在请求反馈之前的历史记录高度相似、反馈长度也差不多的配对——这样做是为了尽量排除掉"是前面的搜索过程不同导致结果不同"这种干扰因素,让最终的成败差异尽可能归因到反馈内容本身的好坏上。
有了这样的配对之后,就可以用直接偏好优化(DPO)的方式来训练:让模型更倾向于生成那条来自成功轨迹的反馈,而不是来自失败轨迹的反馈。
直接偏好优化(DPO):一种不需要单独训练奖励模型,直接通过"哪个更好、哪个更差"的配对数据来调整模型偏好的训练方法
这个设计其实解决了一个很微妙的因果推断问题。假如只是简单粗暴地拿所有成功轨迹里的反馈来做监督学习(论文里对比了这种做法,叫RSFT),那问题在于:一条轨迹最终成功,可能压根不是因为反馈写得好,而是因为它前面的搜索本来就打得基础不错,或者后面的操作恰好运气好蒙对了。这就好比评价一场球赛里教练中场喊的暂停战术管不管用,如果只看喊了暂停之后球队赢没赢,那根本说不清楚是暂停战术真的扭转了局势,还是球队本来实力就更强、迟早会赢。真正说得清楚的办法,是找两场势均力敌、前半场打得差不多的比赛,一场喊了某种暂停战术后赢了,另一场喊了别的战术后输了,这时候把两次暂停的内容拿出来对比,才能真正看出哪种战术更值钱。RDPO用的正是这种"控制变量"的思路,通过前缀匹配的配对,尽量把反馈内容的贡献从一堆混杂因素里剥离出来。
论文的实验也验证了这个设计的价值:经过五轮迭代之后,RDPO在各项指标上都稳定优于简单的正样本模仿(RSFT)。
**两个角色交替升级,谁也不能只顾自己**
CAFE的整个训练流程,就是把"在线智能体优化"和"离线反馈优化"交替进行,论文管这个叫"协同进化"。默认的节奏是每进行100步在线强化学习,就穿插一次离线的RDPO更新,一共循环五轮。
这个设计背后的道理,其实很像两个人一起学一门新技能时互相纠错的过程。假如你和朋友一起学下棋,你负责下棋,朋友负责在你卡壳的时候给建议。如果你一直在进步,棋路越来越复杂,可你的朋友却还停留在最初的水平,给的建议永远是那几句老话,那这些建议很快就不管用了,甚至可能因为跟不上你的水平而把你带偏。反过来,如果朋友的棋评能力突飞猛进,但你自己完全不学、不进步,那再高明的点评也没处发挥。真正有效的进步方式,是你们俩轮流刷新水平,你进步一点,朋友的点评也跟着调整一点,这样才能一直保持"点评正好戳中你当前的痛点"。
论文用实验直接验证了这个道理。他们做了一个对比实验:一组只让智能体那边不断进化,反馈模型固定不变(还是最初的水平);另一组反过来,只让反馈模型进化,智能体固定不变;第三组就是CAFE本身的交替进化方式。结果显示,只优化反馈这一边,分数从67.7涨到71.3就涨不动了;只优化智能体这一边,分数一度冲到84.2,但后面反而回落到了83.6;而两边交替进化的CAFE,最终冲到了86.6,比单独优化智能体的最高点还要高出2.9分。这个结果说明,单方面进步终究会撞到天花板,只有两边协同,进步才能持续下去。
更有意思的是论文接下来做的一个"交叉验证"实验:把不同训练轮次的智能体和不同训练轮次的评论者拿来随意搭配,看看效果怎么样。结果发现,从第三轮到第五轮,每一个智能体在搭配同一轮次的评论者时表现最好。如果把最终版的智能体(第五轮)固定住,换回最初级的评论者,准确率会从80.6掉到84.0(这里指反过来用最新评论者提升的幅度),F1分数也从86.6涨到89.2。但反过来,第五轮的评论者去搭配更早期的智能体,却不一定是最优选择。这说明进步的秘密不在于"评论者绝对水平有多高",而在于评论者的水平是否恰好匹配当前智能体的失败模式。这就像一个经验丰富的老中医,面对一个从没见过的新型病症时,他积累的老经验未必比一个刚好研究过这个病的年轻医生更管用。
**反馈内容本身也在悄悄变化**
论文还做了一个很有意思的观察:随着训练的推进,评论者给出的反馈内容,关注的重点也在系统性地变化。
论文追踪了训练早期、中期、晚期三个阶段里反馈文本中出现频率最高的词汇。早期的反馈大多在纠正一些基础性的错误,比如读错了搜索结果、把不同的实体搞混了。到了中期,反馈开始转向强调证据核实,出现更多类似"确认答案是否成立""是否有明确表述"这样的措辞。到了晚期,反馈的重点又转移到了更高层次的问题上,比如重复的检索、多余的工具调用、逻辑链条上的漏洞。
这个变化规律其实挺符合直觉。当一个学生刚开始学写作文时,老师批改的重点往往是错别字、语病这些最基础的问题;等这些低级错误都改掉了,老师才会开始关注论证是否严密、材料是否可信;等到学生已经能写出条理清楚的文章,老师的关注点就会转向更精细的东西,比如是不是啰嗦了、逻辑上有没有绕圈子。评论者能跟着智能体的错误类型一起升级,恰恰说明它没有停留在最初训练时学到的那套模式,而是真的在跟随智能体的进步不断调整自己的关注点。
**实际效果:七个基准测试,六个都是没见过的题目**
说了这么多机制设计,最终还是要看实际效果怎么样。
论文在七个知识密集型问答基准数据集上做了测试,包括2WikiMultihopQA、HotpotQA、MuSiQue、PopQA、Bamboogle、Natural Questions和TriviaQA,其中只有2WikiMultihopQA是训练时见过的领域内数据,剩下六个全是训练时没见过的领域外数据,用来检验方法的泛化能力。
以70亿参数规模的Qwen2.5-7B-Instruct模型为基础,CAFE最终在这七个基准上取得了最高的平均精确匹配分数(52.5)和第二高的平均F1分数(60.7),比这批实验里表现最强的对照方法IGPO高出2.1个精确匹配点和1.3个F1点。更值得关注的是,这个提升在全部六个领域外数据集上都保持一致,没有出现"只在训练数据上表现好、换个场景就掉链子"的情况。
论文还做了一个从基础模型到最终CAFE的逐阶段对比。原始的Qwen2.5-7B-Instruct模型,平均精确匹配和F1分别是38.1和47.9;加上反馈增强的监督微调之后,提升到40.8和50.1;再加上标准的强化学习(GRPO)优化,进一步提升到49.7和58.0;最后完整应用CAFE的全部机制,达到52.5和60.7。这个逐级提升的过程说明,每一层机制都在真正发挥作用,而不是叠加了一堆花哨的技巧却没有实质效果。
论文特别指出,相比于Search-R1这个基准方法,CAFE在多跳推理类问题(比如需要串联多条线索才能得到答案的题目)上的提升幅度是7.4个精确匹配点、5.9个F1点,而在单跳事实类问题(比如直接查一个事实就能回答的题目)上的提升幅度只有1.3个精确匹配点和1.3个F1点。这个差距恰好印证了论文一开始的核心动机:反馈机制最擅长解决的,正是那种"中途一步错、步步错"的长链条推理场景,如果只是简单的一步查询就能解决的问题,反馈机制自然帮不上太多忙。
论文还在一个规模更小的Qwen2.5-3B-Instruct模型上重复了整个实验,结果显示提升幅度依然明显,达到了48.8和57.4,甚至能和一些70亿参数规模的搜索智能体基准打平。这说明这套协同进化的思路,并不依赖于超大模型才能生效。
除了标准的问答基准,论文还在一个更贴近真实场景、需要更长搜索链条的深度研究基准BrowseComp-Plus上做了测试。结果显示,精确匹配分数从原始模型的4.4一路提升到CAFE的7.7,F1分数从6.8提升到10.6,说明这套方法在更复杂、更长链条的搜索任务里同样有效。
**一个容易被忽视但很重要的副产品:幻觉变少了**
论文里还提了一个数据,我觉得挺值得单独说一说:幻觉率的变化。
幻觉(Hallucination):模型给出的答案里包含了检索到的证据无法支持的、凭空捏造的说法
长链条的搜索任务有一个天生的风险,就是前面某一步的错误信息,可能被一路带到最后的答案里,变成一个看似有理有据、实际上站不住脚的结论。论文用了一个"答案层面幻觉率"的指标来衡量这个问题:只要最终答案里包含至少一个没有被检索证据支持的说法,就算作一次幻觉。
原始基础模型的平均幻觉率是29.9%,也就是说接近三成的答案里都藏着编造的内容。用标准的强化学习(GRPO)训练之后,这个比例降到了17.6%。而用上完整的CAFE机制之后,进一步降到了12.6%。在自然问答(NQ)这个数据集上,幻觉率降低的幅度达到了10.8个百分点,在MuSiQue这个多跳推理数据集上降低了9.4个百点。
这个结果其实很好理解。中途的反馈机制相当于给搜索过程加了一道"证据核实"的关卡,能够在错误的推断刚冒头的时候就被拦下来,而不是让它一路裹挟着积累到最后,变成一个听起来煞有介事的错误答案。
**一个具体的例子:找一条叫"Old Kiln Trail"的徒步路线**
论文里有个具体案例挺能说明问题的。有一道题问的是一条长度大约0.5到1英里、宽度1到3英尺、爬升高度150到400英尺的徒步小径,小径上有一处建于19世纪的建筑遗迹,而且这条小径距离科罗拉多州的某个机场大约218到220英里,距离芝加哥的某个机场大约1104到1106英里。
用普通GRPO训练的模型(没有反馈机制)在处理这道题时,一开始就凭直觉猜测目标机场是丹佛国际机场,然后从这个错误的假设出发,连续做了二十多次搜索,反复变换关键词——从"丹佛附近有19世纪建筑的小径",到"当地历史学会""当地图书馆""当地徒步团体""历史标记牌"……换了各种各样的搜索角度,但始终没有跳出"丹佛"这个错误的地理假设。最终它给出的答案是"Old Elitch's Park Trail",这个答案在整个搜索过程中从来没有任何证据支持,完全是凭空编出来的。
而用CAFE训练的模型,只用了两次搜索就找到了正确答案。第一次搜索之后,结果里其实已经提到了"大湖机场(Grand Junction Regional Airport)"这个位于科罗拉多州的机场,以及它和芝加哥奥黑尔机场之间大约1100英里的距离——这条关键线索本该被立刻抓住,但模型一开始也差点看漏了它,甚至一度自己嘀咕"我好像被搜索结果搞糊涂了"。就在这个当口,它请求了反馈。评论者给出的建议很直接:重新检查已有的搜索结果,注意里面提到的科罗拉多具体地名(大湖城等),把这些地理线索和小径的长度、宽度、爬升高度、19世纪建筑这几个条件结合起来搜。模型照做之后,第二次搜索就直接命中了"Old Kiln Trail"这条正确答案,各项属性完全吻合。
这个对比挺震撼的:同样是走偏了,一个模型花了二十五次搜索也没能纠正过来,另一个模型靠一次恰到好处的反馈,只用了两次搜索就找对了方向。差距不在于谁更努力地搜索,而在于有没有人在关键的岔路口拍一下肩膀,告诉你"你手里其实已经有答案的线索了,回头看看"。
写在后面
读完这篇论文,我印象最深的其实不是那些复杂的公式,而是那个具体的案例对比:二十五次搜索的失败,和两次搜索的成功。
这个数字差距背后藏着一个挺让人不安的事实——很多时候,一个系统(不管是AI还是人)之所以效率低下,并不是因为它不够努力,而是因为它从一开始的方向就错了,而且没有人在合适的时机告诉它这一点。丹佛机场那个案例里,模型其实在第一次搜索里就已经拿到了正确的地理线索(大湖城机场),但它自己没意识到,一头扎进了错误的假设里反复挣扎了二十多轮。这让我想起工作中经常见到的一种情况:有人抱着一个错误的前提做了一整天的工作,如果没人在旁边点一句,这一天可能就白费了。
另一个让我反复琢磨的地方,是论文里提到的那个"反馈内容随训练阶段变化"的现象。早期挑错别字,中期核实证据,后期抓逻辑漏洞——这个规律其实挑战了一个我原本以为理所当然的假设:我一直觉得,一个好的"教练"或者"审校者"应该有一套相对固定的标准,不管教到第几年,标准不该变。但这篇论文说明,真正有效的指导反而应该是流动的,它得跟着被指导对象的水平同步进化,固定不变的标准反而会在某个阶段变得不再适用。这个道理放在教育、管理甚至自我提升上,可能都成立。
还有一点值得多想一层:论文里反复强调,同一套参数、同一个模型,分饰"做事的人"和"挑错的人"两个角色。这听起来像是一种资源上的取巧,但细想下去,它其实暗示了一件更深的事——判断力和执行力,或许原本就不该被割裂成两套独立的系统。一个人只有真正理解"做这件事有多难",才有资格去评判别人做得好不好。这也是为什么很多外行给的建议听起来正确,却总是隔靴搔痒。
这篇论文没有解决的问题也不少。比如反馈机制本身依赖一个更强的教师模型(Kimi-K2.5)来生成初始的训练数据,如果没有这样一个更强的模型可以借用,这套自我进化的循环要怎么从零启动?又比如,这套机制目前只在几个特定类型的知识问答任务上验证过,换到更开放、更需要创造性判断的任务里,"何时该求助""怎么给反馈"这两件事会不会变得复杂得多,甚至难以量化?这些问题,可能要等下一篇论文来回答了。
Q&A
Q1:CAFE框架具体是用来解决什么问题的?
A:CAFE用来解决搜索智能体在多轮检索推理中犯错后无法及时纠正的问题。传统方法只能在任务结束后靠最终结果打分,无法定位中途哪一步出了错,CAFE让模型同时具备做事和挑错两种角色,能在搜索过程中实时请求反馈并纠正方向。
Q2:CAFE和普通的强化学习搜索智能体相比效果提升有多少?
A:在七个知识问答基准测试中,CAFE平均精确匹配分数达到52.5,比表现最好的对照方法IGPO高出2.1分,并且在全部六个训练时没见过的领域外数据集上都保持了提升,同时把答案幻觉率从17.6%降到了12.6%。
Q3:为什么CAFE要让同一个模型既当智能体又当评论者?
A:因为独立训练一个评论者成本很高,而且评论者如果不了解智能体当前的真实水平和错误模式,给出的反馈就会跟不上智能体的进步。共享参数的设计能让评论者始终基于智能体自身的知识和状态来给建议,并且随着智能体训练同步进化,避免反馈内容过时失效。
下一篇:火灾隐患曝光台