Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference
一句话概括
轻量级多模态模型 DRB 能在推理前预测 LLM 的性能。据此可动态分配算力,避免一刀切的高预算浪费。
速览
- 任务:预测 LLM 在不同推理预算下的序数级性能,并动态分配预算。
- 方法:DRB 采用 SigLIP-2 加 Qwen3-0.6B 架构,参数量约 10 亿。
- 关键数字:在 BudgetDoc 上达到 0.753 加权 F1;15 个配置中 9 个匹配或超越最大预算基线。
- 数据与开源情况:摘要未给出。
问题背景
LLM 推理普遍采用一刀切的预算分配。所有输入都给相同或最大的推理预算。
这带来两个问题。
- 成本浪费:简单文档不需要深度推理。它却消耗与复杂文档相同的算力。
- 过度思考惩罚(over-thinking penalty):对简单问题强行增加推理深度。准确率反而下降。
文档理解任务中,视觉布局常是决定复杂度的关键。表格结构、段落排版、图文混排都算视觉布局。现有预算分配方法多只看文本内容。它们忽略视觉信号。
作者由此提出疑问。能否用轻量级多模态模型在正式推理前预检文档?先预测不同预算下的性能,再动态分配资源。
方法要点
方法分三层。
- 构建基准 BudgetDoc。它是首个显式提供模型-预算-性能三重监督信号的多模态文档基准。它覆盖三种文档任务。摘要未说明具体是哪三类任务。每个样本标注了不同推理预算下的模型表现。
- 训练预检模型 DRB。架构为 SigLIP-2(视觉编码器)加 Qwen3-0.6B(语言模型)。参数量约 10 亿。它不直接回答问题。它预测序数级别的性能。给定文档和预算水平,判断表现落在哪个档次。这是分类任务。它在 BudgetDoc 上达到 0.753 加权 F1。
- 动态预算分配。把 DRB 作为预检器接入推理流程。先快速扫描文档,预测各预算下的预期性能。再选择性价比最高的预算实际推理。作者在 5 个前沿模型乘 3 个数据集上验证。
关键结论
- DRB 能预测性能排序。0.753 加权 F1 说明轻量级模型可提取推理难度相关信号。这些信号来自文档的视觉与文本特征。
- 动态分配带来成本收益。15 个配置中,DRB 引导的分配在 9 个配置下匹配或超越基线。基线是始终最大预算。同时推理成本大幅降低。
- 跨模型泛化初现潜力。摘要称初步评估展示了 DRB 跨模型选择的泛化潜力。具体程度与边界,摘要未给出。
读后思考
这篇论文的实用价值直接。它适合几类场景。
- 大规模文档处理流水线。如合同审核、论文批量分析、法律文书审查。文档难度差异大,统一高预算浪费明显。
- 边缘设备上的 LLM 推理。资源受限时,先判断文档值不值得多花算力。这比盲目跑完更明智。
- API 成本优化。按 token 计费的商用模型可用 DRB 作前置路由器。简单文档走低预算,复杂文档才用高预算。
一个值得注意的点:DRB 学的是文档复杂度与模型能力的匹配关系。它不预测绝对难度,而是预测相对性能曲线。这更贴近实际部署需求。
局限与开放问题
- 预测粒度。0.753 的 F1 仍有约 25% 的错误率。关键任务中误判可能导致性能下降。需要安全阈值或回退机制。
- 其余 6 个配置的代价。摘要未说明这 6 个配置中性能损失多少。若损失严重,可能需要更保守的分配策略。
- 跨模型泛化的边界。摘要只说初步评估。它未给出跨模型测试的具体数量与数据分布。DRB 对训练分布外的模型架构是否有效,仍是开放问题。
- 视觉信号的作用未量化。摘要未对比纯文本版与多模态版的差异。无法判断视觉信息贡献了多少预测能力。
- 基准覆盖范围。BudgetDoc 仅覆盖三种文档任务。手写体、扫描件、复杂图表等真实文档类型尚未纳入。基准扩展是后续方向。
总体而言,这篇论文指向一个务实方向。推理不是越多越好,而是越准越好。用一个小模型指挥大模型该花多少力气思考。这可能是 LLM 服务降本增效的重要一环。