MidTool: Mid-training Data Synthesis for Agentic Tool Use
一句话概括
MidTool 是一套面向通用工具调用能力的中间训练语料构建流水线。它用合成监督信号为基座模型打底,在 BFCL、tau2-Bench 和 MCP Universe 上稳定提升下游表现。
速览
- 任务:为智能体工具使用构建开放的中间训练语料,覆盖工具感知、参数抽取、流程编排与信息恢复。
- 方法:融合网页、PDF、代码数据与真实工具 API、MCP 技能、文档驱动工作流的合成监督,形成 MidTool-Mix。
- 关键数字:摘要未给出具体提升幅度、数据规模与混合比例。
- 数据与开源:摘要称该流水线为「开放语料构建流水线」,但未说明代码或语料是否公开。
问题背景
大语言模型的能力塑造分为预训练、中间训练和后训练 3 个阶段。近年研究把中间训练从过渡环节变成主动设计的能力强化窗口。已有工作表明,针对数学、科学等推理密集任务做中间训练,能提升后续 SFT 与 RL 的上限;在软件工程场景中,中间训练也能增强智能体(agent)的代码操作能力。
但有一类智能体能力研究较少:通用工具使用。此时模型面对的不是固定几个 API,而是海量、异构、动态变化的工具集合,如搜索引擎、数据库接口、MCP(Model Context Protocol)服务器、文档查询等。
这类能力与代码生成不同。它要求模型理解工具能做什么(affordance),从上下文抽取参数,组合多步调用流程,并在信息缺失时主动询问或回退。作者指出,现有做法常把工具使用完全交给后训练阶段(SFT + RL)硬学,缺少中间训练阶段的结构化语料。MidTool 正是为填补这一空白。
方法要点
MidTool 的核心是开放语料构建流水线,而非单一模型或训练算法。要点分 4 层。
- 数据来源多样化。大规模收集网页、PDF 文档和代码数据,覆盖工具文档、使用教程、API 参考手册、真实项目调用片段。这些原始数据提供工具使用的自然语境。
- 合成监督信号。利用真实世界工具 API、MCP 技能以及文档驱动的工作流,自动生成带标注的训练样本。合成不是简单拼接,而是围绕 4 个能力维度设计任务模板:
- 工具感知:给定用户请求,判断该调用哪个工具;
- 参数抽取:从自然语言上下文提取工具所需参数值;
- 流程编排:生成多步工具调用序列,并处理中间结果;
- 信息恢复:上下文不足时,生成澄清问题或合理默认值。
- 语料混合(MidTool-Mix)。把合成数据与原始网页、PDF、代码按比例混合,形成最终中间训练语料。混合比例与任务分布经过消融设计,摘要未给出具体数值。
- 训练流程。在 Qwen3-4B-Base 和 Qwen3-8B-Base 上先做中间训练,再统一做后训练,分别采用 SFT 和 RL 两条路线,以验证 MidTool-Mix 对不同后训练策略是否都有增益。
关键结论
- 一致提升:在 BFCL(函数调用)、tau2-Bench(工具代理任务)和 MCP Universe(MCP 生态评测)3 个基准上,使用 MidTool-Mix 中间训练的模型,无论后续用 SFT 还是 RL,都优于不做中间训练的基线。
- 通用性:作者认为通用工具使用与数学、代码等能力一样,值得专门的中间训练阶段,而不是完全依赖后训练。
- 规模效应:摘要提到在 4B 和 8B 两个规模上均有效,但未给出具体提升幅度,也未说明更大规模是否同样受益。
- 数据质量与数量:摘要未给出消融细节,因此无法判断是合成数据的多样性还是任务设计贡献更大。
读后思考
这篇论文把工具使用从后训练的隐式学习,提升为中间训练的显式目标。对实际工程,有 3 个场景值得关注。
- 企业私有 Agent 开发:团队若基于开源基座模型构建内部工具调用助手,可直接复用这套流水线。从文档生成合成训练数据的思路,适合公司内部有大量 API 文档但缺人工标注的场景。
- MCP 生态适配:MCP Universe 作为评测基准之一,说明 MidTool 对新兴 MCP 协议有针对性设计。正在向 MCP 迁移的工具平台,可借这套方法让模型更快适应新协议。
- 数据合成方法论参考:四能力维度任务模板(感知、抽取、编排、恢复)本身就是一个标注框架。即使不采用完整流水线,也可用它评估现有工具调用数据的覆盖度。
局限与开放问题
- 摘要未给出具体数据规模与配比。MidTool-Mix 包含多少合成样本、原始数据与合成数据的比例、各任务模板的采样权重,这些细节缺失,难以复现或评估数据效率。
- 基座模型范围有限。仅在 Qwen3 系列两个小规模模型上验证,未覆盖更大模型或其他架构(如 Llama、Mistral)。工具使用能力在更大模型上是否同样需要中间训练,仍是开放问题。
- 合成数据的真实性边界。虽然使用了真实工具 API,合成监督信号仍可能引入模式化偏差。模型可能擅长模板化调用,却在文档过时、API 返回异常等噪声场景下退化。摘要未讨论鲁棒性测试。
- 与后训练的交互机制。论文表明中间训练加后训练优于纯后训练,但未分析中间训练是否改变 SFT 或 RL 的最优超参数与收敛行为。这属于能力塑造的时序依赖问题。
- 评测基准的覆盖度。BFCL、tau2-Bench 和 MCP Universe 虽具代表性,但都偏向标准化工具调用场景。对长程自主 agent 任务(如跨多天、多系统协作),MidTool 的效果未知。