伊利诺伊大学厄巴纳-香槟分校揭示大模型的规划软肋

金年会体育登录入口

  • 首页
  • 金年会体育登录入口介绍
  • 产品展示
  • 新闻动态
  • 金年会体育登录入口
    你的位置:金年会体育登录入口 > 新闻动态 > 伊利诺伊大学厄巴纳-香槟分校揭示大模型的规划软肋
    伊利诺伊大学厄巴纳-香槟分校揭示大模型的规划软肋
    发布日期:2026-07-13 02:49    点击次数:104

    这项由美国伊利诺伊大学厄巴纳-香槟分校(UniversityofIllinoisUrbana-Champaign)主导完成的研究,以预印本形式于2026年6月4日发布于arXiv平台,论文编号为arXiv:2606.05622v1,研究方向归属于计算机科学中的自然语言处理领域。有兴趣深入了解的读者可通过该编号在arXiv网站上检索完整论文。

    设想一个日常场景:你家里的排水管堵了,你决定向一款智能AI助手求助,让它帮你制定一个修理计划。助手很快给出了一套详尽的步骤,用到了通水管疏通器和橡皮碗。可你告诉它,家里没有疏通器。助手随即调整,改用热水冲洗。你再告诉它,你对高温有顾虑,担心烫伤。助手又改方案……就这样折腾了好几轮,助手要么重复了你之前说过不可以用的工具,要么给出一个在物理上根本行不通的办法。这种体验,相信不少人都似曾相识。

    这正是这项研究所瞄准的核心问题。研究团队将它提炼成一个清晰的问句:面对同时来自"世界"和"用户"两个方向、而且随着对话逐步浮现的限制条件,当今最先进的大型语言模型(简称LLM,即我们常说的AI大模型)究竟能不能做出真正有效的计划?为了回答这个问题,他们构建了一个名为**AdaPlanBench**的交互式动态测试平台,并对十款主流大模型展开了系统性评测。结果令人警醒:即使是目前公认最强的模型,准确率也仅有67.75%,而大多数开源模型的表现则徘徊在30%以下。

    一、为什么"边做边改计划"这件事这么难?

    要理解这项研究的意义,先得弄清楚一件事:AI在规划任务中究竟面临什么样的挑战?

    我们日常解决问题的过程,几乎从来都不是"一步到位"的。修水管、整理房间、做一顿菜——任何一件稍微复杂的家务,都需要在执行过程中不断应对新情况。你打开橱柜发现盐没了,你得临时换食谱;你想用扳手拧螺丝却发现找不到,你得另想办法。人类处理这种"边走边遇坑"的能力,几乎是浑然天成的。

    但对AI来说,这件事并不简单。研究团队将规划过程中的约束条件分成两大类,并称之为"双重约束"。一类是来自外部世界的约束,比如家里没有某件工具、某个设备坏掉了、某种材料不可用——这类约束是客观的、硬性的;另一类是来自用户自身的约束,比如不喜欢用高温的东西、怕噪音、讨厌弄脏双手——这类约束是主观的、偏好性的,往往更模糊也更难捉摸。

    更关键的是,在真实生活中,这两类约束通常不会在对话一开始就全部告知AI。它们是随着交互一点一点浮现出来的。AI提出一个方案,用户说"这个不行",AI修改,用户又说"这个也不行"……每一轮反馈都像是翻开了一张新的牌,AI必须在记住所有已知牌面的同时,持续调整自己的策略。这种"渐进式披露约束"的场景,才是真实世界中AI助手会面对的日常。

    然而,现有的AI评测平台大多只测试"一次性规划"——给AI一个完整的条件清单,让它给出方案,看看答案对不对。这就好比只测试厨师能不能照着完整菜谱做菜,而从不测试他在食材临时缺货时能不能随机应变。这正是这项研究想要填补的空白。

    二、AdaPlanBench是怎么搭建的?——给AI设计一个真实的"家务困境"

    为了在可控环境下模拟这种复杂的现实情况,研究团队以家务类任务为核心场景,搭建了AdaPlanBench这个测试平台。家务场景之所以被选中,是因为它天然地同时存在世界约束(工具是否可用)和用户约束(个人偏好),既贴近生活,又便于评估。

    数据基础来源于一个已有的数据集MacGyver,这个数据集本身收录了大量需要创意解法的家务任务。研究团队从中筛选出307个实例,并对原始问题进行了改写——剔除那些明确要求使用特定工具的描述,把问题改成开放式的,例如把"用吹风机把球晾干"改成"你的排球淋湿了,怎么让它干?"。这样做是为了保留足够大的"解法空间",让AI有机会探索多种可能的方案。

    接着,研究团队用一套自动化的多模型协作流程,为每道题目生成一套"双重约束档案"。这个过程可以理解成一场精心设计的"围堵游戏":系统先让多个不同的AI扮演规划者,各自给出可能的解法;然后把这些解法里用到的工具逐一转化成世界约束(比如"家里没有吹风机")或用户约束(比如"不喜欢用会产生高热的工具");再把这些约束汇总、去重、验证,确保它们既不自相矛盾,也不会让任务变得完全无解。这个过程重复进行三轮,每一轮都在前一轮的基础上引入更多约束,最终形成三个难度等级:低约束版(Elow)、中约束版(Emid)和高约束版(Ehigh)。以中等难度为例,每道题目平均对应约20个世界约束和约22个用户约束,难度之高,颇为可观。

    在评测运行阶段,这些约束都是被隐藏起来的。AI助手只知道任务目标,不知道哪些工具不可用、哪些偏好需要遵守。每当AI提出一个方案,系统就会检查这个方案是否违反了任何约束,如果违反了,就模拟成"用户的反馈",告知AI具体违反了什么,然后要求AI重新规划。就这样,约束像剥洋葱一样一层一层地在对话中浮现,AI必须在每次反馈后做出有效的调整。

    整个交互过程中,世界约束的优先级高于用户约束——只要一个方案同时违反了两类约束,系统优先告知AI关于世界约束的违反,因为这类约束通常是硬性的、客观的,更直接影响方案的可行性。当且仅当世界约束完全满足时,才会揭露用户偏好层面的违规。

    为了防止AI陷入无效的死循环,系统还设置了"早停机制":如果连续两轮AI的方案都没有触发任何新的约束(说明它要么没有真正修改方案,要么修改方向完全走偏),交互就提前终止,并记录为失败。最长交互轮数上限设为20轮,但实际上几乎所有模型在这个上限之前就已经收敛——平均只需要四到六轮。

    三、用什么标准评判AI的表现?——不只看"有没有答案",更看"答案好不好"

    准确率固然是最直观的指标,但研究团队为了更细致地理解AI失败的原因,设计了一套多维度的评估体系。

    最核心的指标是准确率,即最终方案既满足所有约束、又通过质量评审的比例。质量评审由三个不同的AI担任"裁判",从八个维度打分,包括工具可行性(方案用到的工具是否真的在家里能找到)、物理合理性(方案描述的操作在现实中是否真的能产生预期效果)、有效性(整个方案执行下来能不能真正解决问题)和安全性(方案是否会造成人身伤害)等,每项满分5分,低于4分即为不合格。

    除了准确率,研究团队还追踪了几个很有诊断价值的指标。"有效方案率"衡量的是AI最终能不能至少给出一个满足约束的方案,哪怕质量不够高;"重复违规次数"追踪的是AI在已经被告知某个约束之后、又再次违反同一约束的次数,这个指标直接反映AI记住并遵守已披露信息的能力;"平均触发约束数"则衡量AI在每轮交互中触发了多少新约束,这在一定程度上反映AI探索不同解法的活跃程度。

    四、十款主流大模型的真实成绩单——差距比想象中大

    研究团队选取了十款代表性模型进行测试,涵盖GPT-5系列、Gemini系列、DeepSeek-v4-Flash,以及开源阵营的Qwen3系列和Llama-3.3。所有测试均在中等难度(Emid)的场景下进行,以下是一些关键发现。

    表现最好的是GPT-5,准确率67.75%;排名第二的是GPT-5-Mini,准确率61.89%。两款模型的差距并不大,这本身就是一个耐人寻味的结果。Gemini-3-Flash以43.32%排在第三位,Gemini-3.1-Pro反而只有34.53%,落后于自家的"轻量版"。DeepSeek-v4-Flash达到35.53%。而开源阵营的三款Qwen3模型(8B、14B、32B参数量)全部集中在14%到18%之间,尽管参数量相差悬殊,表现却几乎没有区别。Llama-3.3-70B稍好一些,达到29.32%。

    这里有一个很值得注意的现象:几乎所有模型的"有效方案率"都远高于准确率。比如Gemini-3.1-Pro的有效方案率高达91.21%,但准确率只有34.53%;Gemini-3-Flash有效方案率90.23%,准确率43.32%。这说明这些模型并不是完全找不到满足约束的方案,而是找到了方案之后,质量层面出了问题——要么在物理上站不住脚,要么在有效性上差强人意。换句话说,"没有违规"和"真正好用"之间,还横亘着一道不小的鸿沟。

    另一个引人深思的发现是,模型规模的大小并不能可靠地预测规划能力的强弱。参数量从8B到32B的Qwen3系列几乎没有差异,体量差异悬殊的GPT-5和GPT-5-Mini表现相近,而Gemini的"Pro"版甚至输给了"Flash"版。这意味着,在这种需要灵活应对、持续调整的规划任务中,模型的"通用能力越强越好"这一直觉并不成立。

    五、约束越堆越多,AI越来越撑不住——性能随轮次衰减的真实写照

    研究中一个特别关键的发现,是AI的规划质量会随着对话轮次的推进而持续下滑。

    研究团队对交互轨迹做了逐轮分析,追踪了四个主要质量维度(工具可行性、物理合理性、有效性、安全性)在每一轮的得分变化。结果显示,随着被揭露的约束不断累积,各维度得分普遍出现下降趋势,其中有效性和物理合理性的下滑尤为明显。更强的模型(如GPT-5-Mini和Gemini-3-Flash)在各维度上更为稳定,但整体衰减的方向是一致的。

    这种现象的背后,有一个很直观的解释。随着约束越来越多,AI需要同时满足的条件越来越苛刻,可行的解法空间越来越小。在这种情况下,AI往往会被迫采用一些"非常规"的方案——而这些非常规方案,往往在物理上不那么靠谱,或者在解决问题的效果上打了折扣。换句话说,当选择余地变小,方案质量自然也就难以维持。

    将三个难度等级(Elow、Emid、Ehigh)并列比较时,这一趋势更加明显:从低约束到高约束,所有模型的准确率和有效方案率都出现了清晰的下滑。约束越多,AI越容易"力不从心"。

    六、两个"救援方案"效果如何?——显式记忆和质量反馈的作用有限

    面对AI在约束管理上的困境,研究团队尝试了两种直觉上应该有效的干预措施,来诊断问题的根源究竟在哪里。

    第一种干预是"显式约束追踪":在每一轮交互中,把之前已经披露的所有约束作为一个完整的备忘录,直接附在AI的输入信息里。这相当于给AI配了一个"外挂记事本",让它不需要依赖自己的"记忆",而是可以直接查阅所有已知限制。

    结果显示,这个干预确实让有效方案率有所提升,大约提高了5%到15%——说明AI确实存在"忘记已知约束"的问题,显式提醒有助于减少重复违规。然而,准确率的提升却微乎其微,三款被测模型中有三款的准确率提升均不超过3%。这意味着,AI面临的困难并不主要是"记不住",而是"即使记住了,也不知道怎么找到一个真正好的解法"。

    第二种干预是"质量反馈循环":当AI的方案满足了所有约束,但在质量维度(物理合理性、有效性等)上仍有不足时,让系统告知AI具体哪些维度没有达标,并允许它进行最多六轮的修改。

    这个干预的效果更加矛盾。准确率确实有所提升,大约提高了10%左右——这说明质量反馈能帮助AI修正一些局部错误。但与此同时,有效方案率却出现了急剧下滑,两款开源模型的有效方案率下降了约40%,两款专有模型也下降了约20%。出现这种现象的原因,研究团队认为是AI存在一种"近因偏差":当AI收到质量层面的新反馈时,它倾向于集中精力应对新暴露的问题,却在无意中忽视了此前已经满足的约束,导致老问题复发。换句话说,AI很难在修补局部缺陷的同时保持整体方案的一致性。

    七、用户约束比世界约束更难对付——为什么"偏好"比"没有工具"更棘手?

    为了进一步弄清楚是哪一类约束更让AI头疼,研究团队设计了一组对照实验:分别在"仅有世界约束"、"仅有用户约束"和"两类约束同时存在"三种条件下评测AI表现。

    结果出乎不少人的意料:在单一约束类型的情况下,用户约束造成的难度明显高于世界约束。也就是说,"家里没有吹风机"这类客观限制,对AI的困扰反而比"我不喜欢用会产生高热的东西"这类主观偏好要小。当两类约束同时存在时,难度进一步叠加,成为最难应对的场景。

    研究团队对此给出了一个合理的解释:一个用户偏好,往往会排除掉一大类工具或操作方式,而不仅仅是某一件具体的东西。"不喜欢高热"意味着吹风机、热风枪、烤箱、蒸汽熨斗等一系列工具全都不能用;"怕打碎玻璃容器"意味着所有需要用力拧、敲或撬的方法都不适用。相比之下,"家里没有吹风机"只是排除了一件工具,AI还可以转向其他很多选项。正因如此,用户约束对可行解法空间的压缩效果,往往远比表面上看起来要大。

    此外,用户约束的边界也更模糊。"家里没有锤子"是一个清晰的是非判断,但"不喜欢用会产生噪音的方法"就需要AI对工具和操作的属性有更深入的理解——什么算"噪音大"?临界点在哪里?这种模糊性,给判断和调整都带来了额外的难度。

    八、AI最常在哪里出错?——效果不达标和物理常识缺失

    在质量评估的四个主要维度中,AI表现最差的两项是"有效性"和"物理合理性"。

    "有效性"方面的问题,在研究给出的案例中有一个极为典型的例子:一款模型在被要求修复一盏台灯的损坏电线时,给出了一个详尽的"保护方案"——把电线束好、盖上塑料袋、贴上警告标签、放入盒子收纳。整个过程安全有序,条理清晰。但问题在于,台灯的电线从头到尾都没有被修好。用户要的是"修好",而AI给的是"妥善搁置"——这是一种在形式上无懈可击、在目标上却南辕北辙的失败。研究团队将这种现象称为"效果漂移":当约束越来越多,AI在努力避免违规的过程中,悄悄地改变了对任务目标的理解,把"解决问题"偷换成了"避免任何可能违规的操作"。

    "物理合理性"方面的问题则更加有趣。Gemini-3.1-Pro在处理马桶堵塞问题时,给出了一个颇为创意的方案:往马桶里倒入大量冰块,然后按冲水键,利用冰块的重量把堵塞物冲走。这个方案乍听起来似乎有点道理,但实际上完全违背了物理规律——冰块会漂浮在水面上,不会沉入U形管道;一次正常冲水的水量和压力,根本不足以将冰块转化为一个"冲击锤"来疏通堵塞。同一款模型,在被要求熨烫一件有皱纹的衬衫时,提出了"把衬衫铺在地板上,然后把床垫压在上面放置一个小时"的方案。这个方案同样逻辑看起来顺畅(重压可以消除皱纹),但忽略了一个关键事实:消除布料皱纹需要热量和湿气的配合,单纯的物理压力在没有热源的情况下,对纯棉或化纤类面料几乎没有实质效果。

    GPT-5的物理合理性问题则出现在橙汁制作任务上:在一系列约束的压迫下,它提出了"把橙子切成几段,放进冰箱冷冻四小时,然后取出放在筷子上,让汁液自然滴入杯中"的方案。冷冻的确会破坏细胞壁释放汁液,但筷子上架着的橙段在室温下解冻,绝大部分汁液会浸入果肉而非滴入杯中——这个方案在物理上是严重低效的,实际上几乎榨不出什么橙汁。

    这两类错误共同揭示了一个深层问题:当约束越堆越多,AI似乎会进入一种"只求合规、不顾合理"的模式——它把精力集中在如何绕开每一个约束,而不是从物理常识和任务本质出发去设计一个真正可行的方案。

    九、什么样的模型表现更好?——主动探索是关键

    研究中还有一个颇为有趣的正向发现:表现最好的模型,往往也是在交互过程中"触发最多约束"的模型。GPT-5和GPT-5-Mini不仅准确率最高,每轮交互中触发的世界约束数(ATWC)和用户约束数(ATUC)也是所有模型中最高的。统计上,准确率与ATWC的相关系数高达0.898,与ATUC的相关系数为0.919——这是非常强的正相关。

    触发更多约束,意味着AI在每次修改方案时,并不是只做最小限度的调整,而是大幅度地探索不同的方案路径,从而"撞上"了更多此前未曾揭露的约束。从某种角度看,这是一种更积极的探索策略:与其每次只改动一两个细节,不如彻底换一条思路,在更广泛的解法空间里寻找真正可行的出路。

    相比之下,那些触发约束较少的模型,往往是在已有方案的基础上做小修小补,每次只改动一个被点名的违规项,导致整体策略没有实质性进化,最终陷入局部最优的困境。这一发现在某种程度上说明,在这种需要持续应变的规划任务中,"大胆换方案"比"小心修方案"更有效——这与人类在解决实际问题时的直觉颇为吻合。

    说到底,AdaPlanBench这项研究用一套精心设计的"家务困境"揭示了当前AI规划能力的真实底线。当约束只有一两个、而且一次性告知时,今天的AI表现得相当不错。但当约束来自两个方向、而且一点一点地在对话中浮现时,AI的表现就会大打折扣——最好的模型只能做到三分之二正确,大多数模型在三成以下。更令人深思的是,"告诉AI记住已知约束"和"给AI更多质量反馈"这两种直觉上的补救措施,效果都相当有限,说明问题根植于更深层的能力缺陷,而不仅仅是"健忘"或者"粗心"。

    对于普通用户来说,这意味着当你向AI助手寻求复杂任务的帮助时,尤其是在涉及多个个人偏好和现实限制的情况下,最好的策略是从一开始就尽可能把所有约束告知AI,而不是指望它能在反复的来回中自行整合。而对于AI开发者来说,这项研究清晰地指出了下一代模型需要重点突破的方向:如何在长对话中稳定地追踪和遵守不断累积的约束,如何在解法空间被大幅压缩时仍然给出物理上合理、目标上有效的方案,如何避免在应对新问题时丢失对旧约束的遵守。

    这些问题,AI还没有找到令人满意的答案。但研究团队搭建AdaPlanBench的意义正在于此——提供一把精确的尺子,让我们能清楚地看见差距在哪里。感兴趣的读者可以通过arXiv编号2606.05622检索到完整的论文,亲自了解这项测试的完整细节与数据。

    Q&A

    Q1:AdaPlanBench测试平台和普通AI规划测试有什么本质区别?

    A:普通的AI规划测试通常会在一开始就把所有限制条件告诉AI,让它一次性给出答案。AdaPlanBench则模拟了更接近真实生活的场景:限制条件被隐藏起来,只有当AI提出的方案违反了某个限制时,系统才会"告知"AI这个限制存在。这样一来,AI必须在每轮对话后调整方案,同时记住所有已知限制,这对AI的记忆能力和灵活应变能力提出了更高的要求。

    Q2:用户约束为什么比世界约束更让大模型头疼?

    A:世界约束通常是"有没有某件工具"这样清晰的是非判断,排除的只是特定工具。用户约束则往往是偏好性的,例如"不喜欢高温"或"怕噪音",这类约束会一下子排除掉一大类工具和操作方式,对可行方案空间的压缩效果更大。加上用户约束的边界更模糊,AI需要理解工具的隐含属性,判断难度自然也更高。

    Q3:AdaPlanBench的测试结果对普通用户使用AI助手有什么实际参考价值?

    A:研究表明,AI在面对逐步浮现的多重约束时表现明显下滑,因此在向AI助手求助复杂任务时,最好在一开始就把所有已知的限制条件(比如家里没有哪些工具、有哪些个人偏好和禁忌)一并说清楚,而不是等AI给出方案后再逐一纠正。提前告知完整约束,能帮助AI更快给出质量更高的方案,避免多轮无效来回。



    上一篇:原油大跌、黄金上涨,市场抢跑又被打断?
    下一篇:没有了