Mint-Agent: Introducing Finance-Native Agentic Foundation Models
一句话概括
Mint-Agent 是一族金融原生(finance-native)智能体基础模型,靠数据、执行框架与训练算法三大支柱协同设计。它在专业金融基准上兼顾可靠性与长程执行性,并保持推理可审计。
速览
- 任务与方法:面向金融智能体,从数据引擎、MintHarness 执行框架、训练算法三方面构建,训练流程为 SFT、关键步骤 OPD、RLVR,再用模型合并与多教师同策略蒸馏统一。
- 关键数字:Mint-Ag 在 RFC-Bench 达 98.33%;Mint-Cu 在 FinSearchComp T2 达 69.86%;Mint-Ag 在 FinanceAgentBench v1.1 与 v2 分别为 76.00% 和 60.49%。
- 模型规格:两个旗舰模型为 Mint-Cu(9B)与 Mint-Ag(27B)。
- 数据与开源:数据来自真实金融来源,由数据引擎构造任务;开源情况摘要未给出。
问题背景
金融 AI 长期面对一个两难。
- 一边是知识:模型要像资深分析师那样读懂财报、市场动态与监管规则。
- 另一边是执行:金融任务常是多步骤、长周期的研究,例如追踪公司数年供应链变化,或审计衍生品定价的假设链条。
通用大模型在知识问答上表现优异,但在执行层面有短板:长程任务中易丢上下文、产生幻觉,推理过程也缺乏可追溯性。传统金融专用模型则多针对单一任务,如情感分析或实体识别,难以胜任开放式智能体工作流。
论文作者认为,金融智能体需要两种核心能力:可靠性(reliability,基于扎实证据执行精确操作)与执行性(executability,维持长程研究并保证结论可审计)。这两者并非天然共存,需要从模型架构、数据构造到训练策略做系统性设计。
方法要点
Mint-Agent 的构建围绕三大支柱。
1. 数据引擎(Data Engine) 从真实金融数据源出发,自动构造两类任务:一是针对原子金融能力的干净、专业化任务,如财务计算、条款抽取、风险识别;二是长程智能体执行任务,模拟真实研究流程,要求模型在多步交互中完成目标。
2. MintHarness 执行框架 这是论文的关键基础设施组件。它让模型与开放式环境稳定交互,并在整个研究轨迹中维护可审计的证据链。模型每一步决策的依据、引用的数据源、中间计算结果都会被记录,最终结论可回溯验证。这针对的是金融场景中的黑箱推理信任问题。
3. 训练算法组合 训练分几个阶段:先做监督微调(SFT)建立基础能力;再做关键步骤 OPD 强化推理中的关键决策点;最后用基于可验证奖励的强化学习(RLVR)进一步优化。论文分别训练了金融推理专家与智能体执行专家两个专用模型,再通过模型合并和多教师同策略蒸馏,统一成紧凑的通用金融智能体。
最终产出两个旗舰模型:Mint-Cu(9B 参数)与 Mint-Ag(27B 参数),分别侧重执行效率与综合能力。
关键结论
- 可靠性领先:Mint-Ag 在 RFC-Bench 上达 98.33%,超过 GPT-5.6-Sol 和 Claude-Opus-4.8 分别 3.66 和 3.00 个百分点。
- 执行性优势:Mint-Cu 在 FinSearchComp T2 上取得 69.86%,比 Agents-A1-35B 高 22.83 分,比 Nex-N2-mini 高 12.78 分。
- 旗舰综合表现:Mint-Ag 在 FinanceAgentBench v1.1 和 v2 上分别为 76.00% 和 60.49%。
- 小而强的可行性:9B 的 Mint-Cu 在特定执行任务上超过 35B 模型,说明架构与训练策略比单纯堆参数更关键。
摘要未给出:数据构造细节、OPD 的完整定义、模型合并的具体方法、消融实验数据。
读后思考
这篇论文最值得关注的不是某个数字,而是它提出的金融原生设计理念:不是把通用模型微调成金融版,而是从数据、交互框架到训练目标都围绕金融智能体的真实需求来构建。
适用场景较清晰:
- 投研分析:需要多步骤检索、交叉验证与结论溯源,MintHarness 的证据链机制能降低 AI 胡说八道的风险。
- 合规与审计:每步决策有据可查,适合监管要求严格的业务。
- 量化策略研究:长程数据探索与假设验证可自动化,过程可回放。
- 中小机构部署:9B 模型已具备可用性,对算力要求相对友好。
对金融科技从业者,启示是:可审计性不是附加功能,而是金融 AI 的核心架构需求。MintHarness 的思路值得借鉴——即使不用 Mint-Agent 本身,也可在自建智能体系统中引入类似的证据追踪机制。
局限与开放问题
结果亮眼,但有几个问题值得追问,摘要未给出明确答案。
- 基准的泛化性:RFC-Bench、FinSearchComp 等是否覆盖真实业务中最棘手的场景,如极端市场条件下的决策、模糊信息下的推理、对抗性输入(如故意误导的财报)?
- 长程执行的天花板:FinanceAgentBench v2 上 60.49% 意味着仍有近 40% 任务失败。失败源于推理错误、工具调用失误,还是证据链断裂?摘要未提供错误分析。
- 模型合并的代价:通过合并与蒸馏得到统一模型,是否会牺牲某些专项能力?9B 与 27B 之间是否存在明显的性能-效率权衡曲线?
- 数据引擎的可持续性:金融数据时效性强、获取成本高。数据引擎能否持续产出高质量任务,如何避免训练数据中的历史偏差(如牛市样本过多)?
- 可审计性的边界:MintHarness 记录证据链,但可审计不等于正确。若模型第一步就引用错误数据,后续链条再完整也是错的。如何保证证据本身的可靠性,仍是开放问题。
总体而言,Mint-Agent 为金融智能体提供了一个值得参考的系统性方案,但距离可信赖的金融 AI,仍有很长的路要走。