EMON TECH MEDIA · PAPERS — DNA·52CD39

GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI

GRASP 把「复杂任务的自然语言可执行计划生成」拆成生成、修订、评估三个上下文隔离的阶段,用全局宏观准则约束局部策略探索,并用独立的多准则判别器筛选轨迹,从而在多个规划类基准上稳定超过直接让 LLM 出计划的基线,并在多任务并行时几乎消除性能退化。

agent-planning影响力 88.4
arXiv 2609.30147 ↗Arunabh Srivastava, Mohammad A., Khojastepour, Srimat Chakradhar, Sennur Ulukus

GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI

一句话概括

GRASP 把「复杂任务的自然语言可执行计划生成」拆成生成、修订、评估三个上下文隔离的阶段,用全局宏观准则约束局部策略探索,并用独立的多准则判别器筛选轨迹,从而在多个规划类基准上稳定超过直接让 LLM 出计划的基线,并在多任务并行时几乎消除性能退化。

问题背景

论文关注的是一个已经被反复观察到的现象:LLM 的能力并不是随任务复杂度线性增长的,任务越复杂、约束越多、需要协调的子目标越多,模型的可靠性反而下降。在「规划」这类任务上尤其明显——模型需要输出一段可执行的自然语言计划,既要满足全局目标,又要在每一步做出局部合理的选择。

直接让 LLM 一次性生成计划(direct LLM planner)有几个结构性弱点。第一,全局目标与局部决策混在同一个上下文里,模型容易在长链条中丢失早期约束。第二,单一采样路径没有备选方案,一旦某一步走偏,错误会沿链条累积。第三,缺乏独立的评估环节,模型很难对自己的计划做批判性检查——生成者和评估者如果是同一个上下文,往往会倾向于认可自己刚写出的内容。

作者提出的核心判断是:与其让一个模型在一个上下文里同时做所有事,不如把规划流水线解耦成职责单一、上下文互相隔离的模块。这既是工程上的分工,也是对「上下文污染」这一失效模式的对策。

方法要点

GRASP 是一个 strategy-aware 的多阶段规划框架,包含三个模块:

GenPlan(生成):预先编译全局的宏观准则(macro-guidelines)。这一步不针对具体某一步动作,而是先确定整个计划应当遵循的高层策略与约束,相当于给后续所有局部决策设定一个「宪法」。

RevPlan(修订):在相互隔离的上下文窗口中探索不同的局部策略。因为每个候选策略在独立上下文里展开,彼此不会互相干扰,也就避免了单一上下文里「先入为主」的路径依赖。这一步的产出是若干条可比较的候选轨迹。

VerPlan(评估):用一个独立的多准则判别器(multi-criteria discriminator)对候选轨迹打分。判别器与生成过程分离,因此可以相对中立地比较不同策略,而不是复述生成时的偏好。

整体逻辑可以概括为:先定宏观规则,再在隔离环境里并行试探局部走法,最后用独立裁判挑出最优轨迹。作者强调的「strict macro-regularization」指的是宏观准则对局部探索形成强约束,防止修订阶段跑偏。

关键结论(仅基于摘要可合理推断的部分;不确定处标明「摘要未给出」)

摘要给出的量化结果包括:

  • 在 Natural Plan Calendar Scheduling 上,相对直接 LLM planner 提升约 12.4%;
  • 在 ZebraLogic 上提升约 30.8%;
  • 在 SciBench Math 上也有提升,但摘要未给出具体数值;
  • 在多任务扩展(multi-task scaling)场景下,标准规划器会出现性能崩溃,而 GRASP「完全抹平了多任务退化惩罚」;
  • 在交错双任务环境中,相对直接 LLM planner 的绝对准确率提升最高达 16.7%;
  • 通过上下文隔离与严格宏观正则化,GRASP 超过前沿推理模型(如 GPT-5-mini)14.5 个百分点。

需要谨慎的地方:摘要没有说明这些数字对应的具体指标定义(是精确匹配、执行成功率还是别的)、数据集规模、基线配置,也没有给出方差或多次运行的稳定性信息。所谓「完全抹平」是一个强表述,摘要未给出其量化口径。此外,14.5% 的对比中 GPT-5-mini 的具体设置(是否同样做了多阶段提示、是否给了同等上下文预算)摘要未给出,因此这一比较的公平性无法从摘要判断。

读后思考 / 适用场景

GRASP 的思路本质上不新——「生成者与评估者分离」「先定策略再定动作」在规划与强化学习里都有对应传统。它的价值在于把这套分工用上下文隔离的方式落到 LLM 上,并且给出了跨多个基准的一致收益。这提示我们:当前 LLM 规划失败的一个主要来源可能不是「不会推理」,而是「在一个上下文里同时承担太多角色」。

适用场景上,最直接的是需要输出可执行步骤序列的任务:日程排布、约束满足类谜题、带计算的科学问题求解。多任务场景下的收益尤其值得注意——如果 GRASP 真能在并行任务增多时保持不退化,那它对需要同时处理多个规划请求的 agent 系统就有实际工程意义。

局限与开放问题

第一,多阶段流水线意味着多次模型调用,推理成本与延迟会显著高于单次直接生成。摘要没有给出任何成本或 token 消耗的对比,因此「性能提升是否值得这些额外开销」无法判断。

第二,VerPlan 的判别器本身也是模型,它的评判标准从何而来、是否可被生成模块「迎合」、在分布外任务上是否仍然可靠,摘要未给出。判别器一旦有系统性偏差,整个筛选环节就会放大这种偏差。

第三,宏观准则(GenPlan)的质量依赖任务先验。对于结构清晰的任务(日历排程、逻辑谜题)容易写出有效准则,但对于开放域、目标本身模糊的任务,宏观准则可能反而成为束缚。摘要未讨论这类任务上的表现。

第四,摘要报告的提升幅度较大,但缺少对基线提示工程强度的说明。如果基线是朴素的单次提示,那么部分收益可能来自「多阶段」这一形式本身,而非 GRASP 的具体设计。要确认各模块的独立贡献,需要消融实验,摘要未给出。

第五,多任务「完全抹平退化」这一结论如果成立会很有意思,但机制解释缺失:是上下文隔离起了作用,还是宏观准则提供了跨任务的一致锚点?这值得后续工作拆解。

本页为科普精读;细节以 arXiv 原文为准。就本篇提问请点左下角「论文研读助手」。