EMON TECH MEDIA · PAPERS

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

这篇论文研究了一个非常实际的问题:当我们为智能体(Agent)系统同时优化「外挂装备」(Harness,即提示词、工具、执行框架等)和「模型本身」(权重微调)时,两者会发生冲突。作者发现,用专家轨迹直接训练弱模型会破坏模型与已进化装备的适配性,导致性能不升反降;他们提出了一种「在线策略专家修正」的流水线,只让专家改写弱

agent-harness影响力 88.1
arXiv 2609.09134Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra, Sougata Chaudhuri, Shilpa Bhagavath

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

一句话概括

这篇论文研究了一个非常实际的问题:当我们为智能体(Agent)系统同时优化「外挂装备」(Harness,即提示词、工具、执行框架等)和「模型本身」(权重微调)时,两者会发生冲突。作者发现,用专家轨迹直接训练弱模型会破坏模型与已进化装备的适配性,导致性能不升反降;他们提出了一种「在线策略专家修正」的流水线,只让专家改写弱模型自己犯错的那一步,从而兼顾装备进化与模型适配。

问题背景

大语言模型(LLM)在智能体任务中的表现,不只取决于模型权重本身,还取决于围绕它的整套「脚手架」——系统提示词、可用工具集、执行钩子、上下文管理策略等,论文统称为 harness。一个精心设计的 harness 可以让较小的模型在特定领域任务上达到接近前沿模型的效果,成本却低得多。

既然 harness 和模型权重都会影响行为,一个自然的问题是:两者能否协同进化?作者在七个企业级智能体任务上先为弱模型进化出合适的 harness,然后发现一个有趣现象:更强的专家模型用这套 harness 时表现更好,说明专家监督可能弥补剩余差距。于是他们尝试让弱模型模仿专家的完整轨迹来微调,结果却出人意料:在 Qwen3-Coder 和 Gemma 4 上,七个任务全部退步 4 到 30 个点。而同样的模仿流程在未进化的 harness 下反而有效。

这个矛盾揭示了「装备进化」与「权重更新」之间可能存在的深层冲突,正是论文要解决的问题。

方法要点

论文的核心方法分为三步:

第一步:Harness 进化。 先用弱模型在目标任务上进化 harness,使其适配弱模型的原生规划风格。这一步是后续所有工作的基础。

第二步:诊断冲突根源。 作者通过分析发现,模仿学习确实让弱模型学到了知识,也增加了对 scaffold(脚手架工具)的使用频率,但问题出在「模型-harness 适配」上:弱模型采纳了专家的规划策略,却没有执行该策略的能力,同时它也不再匹配那个围绕自己原生风格进化出来的 harness。简而言之,弱模型「穿上了不合身的衣服」。

第三步:在线策略专家修正(On-Policy Expert Correction)。 作者设计了一个流水线,由一个元层面的 MLE(最大似然估计)智能体自动驱动。具体做法是:让弱模型在自己的 rollout 中执行任务,定位到失败的那一轮(turn),然后只请专家改写这一轮的内容,其余部分保持弱模型自己的规划风格不变。这样既保留了模型原有的规划方式,又结合了 harness 进化和模型适配的双重收益。

关键结论

基于摘要可合理推断的结论包括:

  1. 模仿完整专家轨迹在已进化 harness 下会适得其反:在全部七个企业任务上,Qwen3-Coder 和 Gemma 4 的性能均出现 4 到 30 个点的退步,而同样的流程在未进化 harness 下是有帮助的。这一对比强烈说明问题出在 harness 与模型更新的交互上。

  2. 冲突机制已明确:模仿转移了知识并增加了 scaffold 使用,但破坏了模型与 harness 的适配——弱模型「学到了专家的计划却执行不了」,同时不再匹配围绕自己风格进化的 harness。

  3. 在线策略专家修正有效:只修正失败轮次、保留模型原生规划风格的方案,能够兼容 harness 进化与模型适配,实现两者的协同增益。

摘要未给出具体性能数字、修正轮次的比例、MLE 智能体的具体实现细节,也未说明该方法在不同任务类型上的效果差异。

读后思考 / 适用场景

这篇论文的实用价值很高,尤其适合以下场景:

企业领域智能体部署:当你想用较小、较便宜的模型完成特定领域任务(如客服、内部工具调用、数据分析),又希望不断优化系统时,这篇论文提供了一条「省钱又有效」的路径——不必每次都请专家标注大量完整轨迹,只需在关键失败点做局部修正。

Harness 与模型联合调优的工程实践:很多团队会分别优化 prompt 和微调模型,但很少意识到两者可能互相干扰。这篇论文提醒我们:先改装备再改模型,顺序很重要;改模型时要注意保留其与装备的匹配度。

数据高效的监督策略:相比完整轨迹模仿,只修正失败轮次的做法在标注成本上也更经济,因为专家只需关注出问题的那一步,而不是从头到尾重写。

局限与开放问题

摘要未给出的一些关键信息值得注意:

任务范围有限:所有实验都在七个企业级任务上进行,这些任务可能有共同的结构特征(如多轮工具调用、结构化输出),在其他类型任务(如开放域对话、创意写作)上是否同样成立尚不清楚。

弱模型与专家的差距范围未知:摘要没有说明弱模型和专家模型的具体规模差距,如果差距过大或过小,结论可能不适用。

MLE 智能体的可靠性:自动定位「失败轮次」本身依赖一个元层面的智能体,如果这个定位不准确,整个流水线的效果会受影响,但摘要未给出定位准确率的评估。

长期进化的稳定性:论文展示了一轮 harness 进化 + 一轮模型修正的效果,但多次交替迭代是否收敛、是否会出现震荡,仍是开放问题。

「规划风格」的定义与度量:论文的核心论点是「保留模型原生规划风格」,但如何形式化定义和度量这种风格,摘要中并未展开,这可能是后续研究需要补上的理论基石。

本页为科普精读;细节以 arXiv 原文为准。就本篇提问请点左下角「论文研读助手」。