Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL
一句话概括
Envs-FORGE 提出了一种面向智能体强化学习的“前沿导向、奖励驱动”环境合成策略:它不再对每个种子任务套用固定提示模板,而是根据当前策略在验证器上的通过率,用混合整数线性规划(MILP)为每个种子动态选择“该变难、变易还是换方向”的生成动作,从而产出可执行、可验证、难度匹配的训练环境。
问题背景
强化学习训练终端智能体(terminal agent,如代码生成、工具调用类模型)时,最核心的瓶颈不是模型参数量,而是训练环境的“质量供给”。理想训练环境需要同时满足三个条件:可执行(环境能跑通)、奖励可靠(有明确的验证信号)、难度合适(不能太简单也不能太难)。
现有主流做法是固定配方(fixed recipe),包括 few-shot 采样、Self-Instruct 和 Evol-Instruct。这些方法对每个种子任务使用完全相同的提示策略,比如“请把这个问题改难一点”或“请生成一个类似的新问题”。问题在于:不同种子任务对当前策略的挑战程度完全不同——有些任务策略已经轻松通过,需要加难;有些任务策略完全做不出来,需要降低难度或换一个角度;还有些任务虽然能通过,但覆盖的技能方向太窄。固定配方无法感知这些差异,导致生成的环境要么大量冗余(策略已会),要么难度失配(策略完全不会),训练效率低下。
Envs-FORGE 的核心动机是:把“验证器奖励”这个信号从训练后的评估工具,前置到环境生成的过程中,让生成策略像 RL 策略一样,根据当前模型能力动态调整“生成动作”。
方法要点
Envs-FORGE 的流程可以拆成四个关键步骤:
1. 种子通过率估计。 对每个种子任务,先用当前策略模型跑一遍,得到该种子在验证器上的通过率(pass rate)。这个通过率是后续决策的基础信号。
2. 六方向动作空间。 围绕一个“目标学习前沿”(target learning frontier),定义六个投影方向动作(projection-direction actions)。虽然摘要未给出六个方向的具体名称,但可以合理推断它们覆盖了“加难、减易、换领域、改形式、增约束、变接口”等维度。每个动作本质上是把当前种子映射到目标难度区间的一个方向向量。
3. 每种子 MILP 决策。 对每个种子,构建一个混合整数线性规划问题。决策变量是选择哪个方向动作,约束条件包括:目标通过率区间、难度变化幅度、与已有环境的重复度等。MILP 的目标是最大化“该动作对当前策略学习价值的预期提升”。求解后,选中的动作驱动对指令(instruction)、测试夹具(fixtures)、标准答案(oracle solution)、测试用例(tests)和 Docker 环境的同步重写。
4. 金验证过滤与技能覆盖。 只有通过验证器“金标准”检查的环境包(gold-verified bundles)才进入 RL 训练。此外,MILP 的索引形式还支持可选的软技能覆盖约束,用于组合规划时保证生成环境覆盖不同技能维度。
关键结论
基于摘要,可以确认以下结论:
- 主结果提升显著。 在 Qwen 3.5 35B 上,tb-core 的 Pass@1 从 Base 的 40.0% 提升到 49.2%(+9.2 个百分点),tb-2.0 从 23.0% 提升到 29.4%(+6.4 个百分点)。
- 优于最强固定配方基线。 相比最强的固定配方基线,Envs-FORGE 在 tb-core 上高出 2.4 个百分点,在 tb-2.0 上高出 2.1 个百分点。
- 跨模型规模泛化。 在 4B 到 35B 的多个模型规模上,tb-core 均有 6.8–9.2 个百分点的提升。
- 通用基准表现。 在 SWE-bench Verified 上达到 77.1%,Base 为 73.4%。
- 公平对比条件。 所有合成方法均导出 100 个已验证环境,合成 token 消耗在 2.27M–2.88M 之间,说明对比是在相同训练集规模和相同算力消耗下进行的。
摘要未给出的部分包括:六个方向动作的具体定义、MILP 的求解时间开销、不同模型规模下的具体分解结果、以及软技能覆盖对最终性能的边际贡献。
读后思考 / 适用场景
这篇工作的核心价值在于把“环境生成”从一个启发式过程变成了一个可优化的决策问题。它最适用的场景是:已有验证器(verifier)且验证成本可控的领域——典型如代码生成(有单元测试)、数学推理(有答案校验)、SQL 生成(有执行结果比对)。在这些场景中,验证器能提供可靠的通过率信号,MILP 的决策才有依据。
另一个值得注意的点是“同步重写”策略。很多环境合成方法只改指令不改测试,导致生成的环境虽然“看起来新”,但测试逻辑和原种子高度雷同。Envs-FORGE 强调对指令、夹具、标准答案、测试、Docker 环境五要素的同步改写,这更接近真实世界的任务变体生成,能有效防止策略“背答案”。
对于 RL 训练管线设计者,这篇工作的启示是:环境生成策略本身也可以是一个 RL 问题——用验证器奖励作为反馈信号,用 MILP 作为决策器,相当于在环境生成层面做了一个“离线 RL 策略”。这种思路可以推广到其他需要动态生成训练数据的场景,比如对话数据增强、工具调用轨迹合成等。
局限与开放问题
最明显的局限是对验证器的强依赖。如果任务没有可靠的自动验证器(如开放式写作、创意设计),通过率信号就无法计算,整个框架会失效。摘要中也未讨论验证器本身有误判时的鲁棒性。
其次是 MILP 的可扩展性。虽然摘要提到“索引形式”支持软技能覆盖,但每种子求解一个 MILP 的计算开销在超大规模(如百万级种子)下可能成为瓶颈。摘要未给出求解时间数据。
第三个开放问题是前沿定义的敏感性。目标学习前沿(target learning frontier)如何设定?是固定阈值还是动态调整?摘要未说明前沿的具体计算方式,这可能是复现时最大的不确定性。
最后,合成 token 消耗的公平性虽然被强调(2.27M–2.88M),但固定配方基线是否也做了同样的验证过滤?如果基线没有经过金验证过滤,那么性能差距可能部分来自“验证过滤”而非“动态决策”。摘要未明确这一点。
