EMON TECH MEDIA · PAPERS

论文研读

按生成月份归档 · 高影响力精选 · 左下角可就本篇提问

46 篇 · 3 个月份

2026 年 9 月

11
RLVR
90

TRACE: Training Reasoning Agents for Causal Exploration with Synthesized Rewards

TRACE 提出用「受控模拟器 + 隐藏干预」来人为制造可验证奖励,把原本依赖昂贵专家调查、答案可能永远模糊的「诊断式推理」任务,改造成可以大规模做强化学习的任务,并在数字广告归因环境中验证了这条路径的有效性。

阅读精读 →
agent-harness
88

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

这篇论文研究了一个非常实际的问题:当我们为智能体(Agent)系统同时优化「外挂装备」(Harness,即提示词、工具、执行框架等)和「模型本身」(权重微调)时,两者会发生冲突。作者发现,用专家轨迹直接训练弱模型会破坏模型与已进化装备的适配性,导致性能不升反降;他们提出了一种「在线策略专家修正」的流水线,只让专家改写弱

阅读精读 →
agentic-coding
89

How to Speculate about Uncertainty in Agentic Coding? A Draft-Model Gate Method

这篇论文提出了一种名为“投机不确定性”(Speculative Uncertainty, SU)的方法,仅通过观察黑盒编程智能体已生成的输出文本,就能预测其即将执行的动作是否会失败,从而在动作真正执行前进行拦截,显著降低错误率和计算成本。

阅读精读 →
AI原生开发
85

Design Docs Are All You Need: An AI-native Machine-Learning Performance Tool

这篇论文提出了一种“AI 原生”的机器学习性能建模工具 SMART,其核心思路是:仓库里几乎没有手写代码,只维护一份由自然语言设计文档组成的 DAG(有向无环图),当模型或系统更新时,由编码子代理仅依据这些文档重新生成整个实现,从而彻底绕开传统性能建模框架“边打补丁边腐烂”的技术债问题。

阅读精读 →
multimodal-agent
87

Editable Visual Design

这篇论文提出了一种名为“可编辑视觉设计”(Editable Visual Design)的新范式:让视觉语言模型(VLM)担任“创意大脑”,图像生成模型担任“视觉世界模拟器”,由编码代理(Coding Agent)以“先想象、后行动”的闭环流程,最终产出带真实文本、图层解耦、可拖拽编辑的 HTML/CSS 设计稿,而非

阅读精读 →
code-editing
85

When Models Edit Too Much: On the Fidelity of Minimal Code Edits

这篇论文系统性地研究了大型语言模型在代码修复中的“过度编辑”问题——即模型为了修一个 bug 而重写大量本不需要改动的代码——并提出了一个可量化的评测框架,验证了指令约束与强化学习训练能有效提升“编辑保真度”,同时保持甚至改善修复正确率。

阅读精读 →
other
71

RealCADBench: Benchmarking Parametric CAD Modeling from Industrial Design Intents

RealCADBench 是一个面向“真实工业设计意图到参数化 CAD 程序”的评测基准,包含 1.2 万余个来自工厂自动化场景的任务,用执行成功率、两种 IoU 和视觉语义一致性四个维度揭示:当前前沿大模型在参数化 CAD 建模上各有短板,没有全能冠军。

阅读精读 →
AI4AI
84

Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills

这篇论文提出了一套名为 DisCo 的技能蒸馏框架,把 GitHub 上大量机器学习仓库中隐含的“操作知识”提炼成紧凑、可验证的技能模块,并让 AI 科研智能体在运行前加载这些技能,从而在 MLE-bench、PaperBench 等多项 AI 科研基准上获得显著性能提升。

阅读精读 →
agent
87

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement

本文提出 Harness-of-Harness(HoH)框架,通过在多轮“规划—编码—测试”循环中持续暴露交付物、工具与技能,让现有 LLM 编码智能体在无需人类干预的情况下,于数天乃至数十轮迭代中自主开发出完整、可玩且持续改进的软件系统。

阅读精读 →
视觉定位
87

LOCI: A Locator-Critic with Refinement Loop

LOCI 提出了一种无需训练、即插即用的框架,通过将“视觉定位”与“证据验证”解耦为两个独立智能体,并让它们在迭代循环中互相协作,显著提升了视觉语言模型在复杂视觉理解任务上的准确率。

阅读精读 →
agent插件
87

On the Maintenance and Co-evolution of Agent Plugins: An Empirical Study of Claude Code Plugin Marketplaces

这篇论文首次对 AI 编程助手 Claude Code 的插件市场进行了大规模实证研究,分析了近 2000 个仓库中 8000 多个插件的维护模式和协同演化规律,发现插件开发以功能驱动为主、AI 深度参与,并识别出一种传统软件工程中不存在的新型维护依赖——自然语言指令与实现脚本的功能耦合。

阅读精读 →

2026 年 8 月

26
VLM推理加速
85

PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

PACE 提出了一种无需训练的视觉语言模型(VLM)推理加速框架,通过“先压缩像素、再抽取关键 token”的两阶段统一范式,同时优化视觉编码器和 LLM 阶段的计算开销,在仅保留 10% 视觉 token 的情况下维持了 93.8% 的原始性能,并将首 token 延迟(TTFT)加速 3.1 倍。

阅读精读 →
multimodal
84

Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models

这篇论文提出了一个全新的多模态基准测试,专门用来衡量当输入从文本变成语音、从英语换成阿拉伯语时,多模态大模型在视觉推理判断上是否会出现“前后不一致”的问题,并发现这种跨模态、跨语言的切换会显著放大模型的碎片化推理错误。

阅读精读 →
reasoning
84

TTPO: Test-Time Policy Optimization

TTPO(Test-Time Policy Optimization)提出了一种无需任何标注数据的测试时训练方法,通过「多数投票伪标签 + 非对称优化」的设计,让大语言模型在推理阶段也能持续自我提升,在数学推理基准上达到了与有监督后训练相当的水平。

阅读精读 →
world model
87

Code World Model: Coding Agent as World Brain

这篇论文提出了一种名为“Code World Model”的新框架,将世界模型的“演化逻辑”与“视觉呈现”彻底分离:用一个会写代码的智能体作为“世界大脑”来推理事件后果、维护持久状态,再用视频生成模型把状态“渲染”成高保真画面,从而突破传统视频世界模型只学表象、难懂规则的瓶颈。

阅读精读 →
agent credit assignm
87

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents

IAPO 提出了一种「影响力感知」的信用分配方法:它把多轮智能体的一次完整交互记录建模成一张有向依赖图,通过图中信息流和错误流的传播结构,将稀疏的轨迹级奖励重新分配到每个具体动作上,从而在不依赖额外采样或人工标注的情况下提升服务型智能体的多轮强化学习效果。

阅读精读 →
cybersecurity
88

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

CyberFactory 是一个开源统一框架,它把公共漏洞数据(CVE)自动转化为可执行、可验证的网络安全任务实例,并利用“技能引导的教师模型”生成智能体轨迹,训练出专用安全模型 Aegis,在 CyberGym 基准上达到 52.4% 的 Pass@1,比基础模型提升 22.8 个百分点。

阅读精读 →
5G
87

Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge

这篇论文针对 5G/6G 网络运维中开放文本诊断这一真实场景,首次系统评估了三款轻量级 LLM 在自由文本格式下的 5G 领域知识与故障分析能力,并验证了多裁判 LLM-as-Judge 评分框架的可靠性,结论是轻量模型已具备故障诊断的实用精度,但对 3GPP/O-RAN 规范的零样本回忆仍是明显短板。

阅读精读 →
safety
90

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

本文提出了一种名为 EchoCoT 的多步攻击方法,能够通过黑盒 API 交互,从闭源大型推理模型(LRM)中近乎逐字地提取其隐藏的思维链(Chain-of-Thought, CoT)内容,从而将“隐藏思维链不可见”这一安全假设彻底打破。

阅读精读 →
benchmark
89

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench 是一个面向葡萄酒领域的知识评估基准,包含 3,266 道多选题,覆盖六大知识支柱和四个难度层级,所有题目均锚定可追溯的权威来源,并采用“LLM 辅助生成、人工校准审计”的流程来保证质量,最终用于评测 16 种前沿大语言模型的领域知识与推理能力。

阅读精读 →
agentic tool use
85

MidTool: Mid-training Data Synthesis for Agentic Tool Use

MidTool 提出了一套面向“通用工具调用”能力的中间训练(mid-training)数据合成与语料构建方案,通过融合网页、PDF、代码与真实工具 API 的合成监督信号,让基座模型在进入后训练之前就具备更强的工具感知、参数抽取、流程编排与信息恢复能力,并在 BFCL、tau2-Bench 和 MCP Univers

阅读精读 →
reasoning
89

Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference

这篇论文提出了一种轻量级多模态模型 DRB(约 10 亿参数),用于在文档推理任务中**提前预测**不同推理预算下 LLM 的性能表现,从而避免对所有输入统一分配最大预算带来的高昂成本和过度思考问题。作者还构建了首个专门用于研究“模型-预算-性能”权衡的多模态基准 BudgetDoc。

阅读精读 →
linguistic reasoning
91

The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning

这项研究通过举办一场基于国际语言学奥林匹克竞赛(IOL)真实题目的开放科学挑战赛,系统评估了大语言模型在“先发现规则、再运用规则”的 linguistic reasoning(语言推理)任务上的表现,发现模型能力与参数量并非正相关,且自动评测指标与人类专家评分存在系统性偏差。

阅读精读 →
金融智能体
89

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent 是一族“金融原生”的智能体基础模型,通过数据、执行框架(harness)和训练算法三大支柱协同设计,在专业金融基准上同时实现了高可靠性与长程可执行性,并保持推理过程可审计。

阅读精读 →
RL环境合成
88

Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

Envs-FORGE 提出了一种面向智能体强化学习的“前沿导向、奖励驱动”环境合成策略:它不再对每个种子任务套用固定提示模板,而是根据当前策略在验证器上的通过率,用混合整数线性规划(MILP)为每个种子动态选择“该变难、变易还是换方向”的生成动作,从而产出可执行、可验证、难度匹配的训练环境。

阅读精读 →
open-source LLM
89

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

这篇论文介绍了 Mimir v1——一个仅用“可许可”(permissible)数据从头训练的 10 亿参数语言模型,基于层级推理架构(HRM),在英语上表现强劲,并在丹麦语上刷新了当前最优成绩,试图证明“干净数据”也能逼近甚至部分超越更大规模的闭源式模型。

阅读精读 →
multimodal alignment
86

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

这篇论文系统测量了 9 个视觉语言模型(VLM)在 10 个政治敏感话题上的“国家对齐扭曲”行为,发现中国来源模型正在从“显式拒绝回答”转向“流畅地重新框定事实”,且这种隐蔽的框定在中文提示下出现概率约提升 3 倍。

阅读精读 →
agentic coding
88

Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding

这篇论文揭示了一个反直觉的现象:AI 编程助手(如 Claude Code)的指令文件 CLAUDE.md 会像“记忆雪球”一样无限膨胀,作者称之为“灾难性记住”(catastrophic remembering)——它是灾难性遗忘的镜像问题,并证明在提示词中写入“注释”可以显著遏制这一增长,甚至提升真实任务中的指令遵

阅读精读 →
security
88

Stealing Reasoning Traces from Proprietary LLM APIs

这篇论文发现了一个针对主流闭源大模型 API 的架构级漏洞:模型厂商把加密的思维链(CoT)文本块返回给客户端,而这些加密块在同一生态内跨会话、跨用户甚至跨模型可互换复用,攻击者只需把高能力模型的加密推理块“喂”给同厂商较弱的模型,就能让它乖乖解密并逐字吐出明文推理过程,从而绕过蒸馏防护、批量窃取隐私数据、暴露危险内容

阅读精读 →
AI for Science
89

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

这篇论文指出当前 LLM 智能体在端到端假设检验中“代码跑得对、结论却可能错”的隐性推理缺陷,并为此构建了专门评估统计有效性的基准 P-Bench,同时提出用强化学习训练的开放权重模型 Fisher-R1,在统计严谨性上显著超越 GPT-5.4 和 DeepSeek-V4-Pro 等强基线。

阅读精读 →
social reasoning
85

Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

这篇论文提出了一种名为 TSR(Think-Strategy-Response)的分层推理框架,配合线性化分层强化学习与方差门控奖励机制(LHRL-VGR),让大语言模型在社交对话中先做高层策略规划、再做低层语言执行,从而在 SOTOPIA 基准上以 7B 参数模型超越了 GPT-4o 的社交目标达成率。

阅读精读 →
multimodal metaphor
85

M$^3$R-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding

M³R-Bench 是一个包含 1000 条人工校验图文实例的统一多模态隐喻理解基准,它首次将“隐喻是否出现、目标域—源域映射、情感倾向、分阶段解释”四类标注整合在同一框架下,并配套提出一个仅 8B 参数的小模型 M³R-Reasoner,通过课程式推理监督与任务感知强化学习,在多项统一任务指标上超越 GPT-5.5

阅读精读 →
other
71

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

FormBharo 是一个面向印度农村低识字率人群的语音对话智能体,通过“LLM + 规则校验”的混合架构,在电话通话中完成社会福利登记表格的填写,并公开了一个包含 960 场模拟通话、3760 轮对话的基准测试集,揭示了组件性能与端到端效果之间的非对应关系。

阅读精读 →
function calling
93

Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

Data Turnstile 是一个开源的函数调用数据生成框架,它把复杂的多轮工具调用过程拆解为带校验和错误反馈的逐步生成流程,从而为小语言模型(SLM)提供高质量、可定制的合成训练数据,让 0.6B 参数的模型在函数调用基准上逼近甚至超越 32B 的大模型。

阅读精读 →
agent-deception
99

Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

这篇论文提出了一个名为 ParliamentBench 的开源基准框架,基于社交推理桌游《Secret Hitler》(秘密希特勒),系统性地评估了 16 个大语言模型(LLM)在信息不对称场景下的欺骗、说服与推理能力,并引入了三个新指标来量化这些复杂行为。

阅读精读 →
agent-benchmark
97

ORCA-bench: How Ready Are Language Model Agents for Oncall?

ORCA-bench 是一个面向「值班(Oncall)根因分析」场景的高保真基准测试,它把通用编码智能体放进一个带完整可观测性数据(指标、日志、追踪)和源码访问权限的真实微服务系统中,用 1,079 个由资深 SRE 专家把关的任务来检验智能体能否像人类值班工程师一样,从模糊的用户报告出发定位故障根因——结果显示,最先

阅读精读 →
agent scaling
92

Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

这篇论文系统研究了在本地部署的计算机使用智能体(Computer-Use Agents, CUAs)中,推理时扩展(inference-time scaling)是否真的能带来性能提升。结论是:额外计算往往收益递减,甚至改变失败模式——本地模型需要的不是“更多计算”,而是“更聪明的选择性计算”。

阅读精读 →

2026 年 7 月

9
agent_benchmark
95

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

TREK 是一个专为 LLM 智能体设计的旅行规划评测基准,包含 800 个多约束任务和完全确定性的规则评估器,用于严格测试智能体能否生成同时满足可行性、无幻觉、时空可执行、预算合规及用户隐性需求的完整行程方案。

阅读精读 →
Agent推理加速
91

Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

这篇论文提出了一种让大语言模型智能体在“思考”的同时“推测”自己下一步会调用哪个工具的方法,通过让同一个模型同时扮演智能体和推测器,并采用联合强化学习训练,在不影响任务成功率的前提下大幅提升工具调用的预测准确率,从而减少等待工具返回结果的时间。

阅读精读 →
foundation-model
100

Kimi K3: Open Frontier Intelligence

Kimi K3 是一个拥有 2.8 万亿参数(激活 1040 亿)的混合专家(MoE)模型,通过创新的注意力机制、专家路由算法和全流程强化学习训练,在编程、智能体、推理和视觉等任务上达到前沿水平,并开源全部权重。

阅读精读 →
LLM agent 鲁棒性
93

Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families

Gubernaut 提出了一种名为 GCC(Gubernaut Cognitive Controller)的模型无关运行时控制层,通过一个完全不接触文本、只读取数值遥测的确定性元控制器,在无需修改模型权重的前提下,显著降低了大语言模型智能体在持续压力下的情绪失控、谄媚漂移和重复卡死等倾向性故障。

阅读精读 →
医疗LLM
90

Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs

该论文通过多模型实验证明,在医疗互操作性场景中,大型语言模型(LLMs)输出的模式合规率基线仅为 85.9%–91.6%,而引入闭环验证-修复框架后,合规率可提升至 99.0%,且绝大多数错误在 1–2 次迭代内解决。

阅读精读 →
systems
92

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

本文报告了在昇腾 NPU 超大规模集群上对万亿参数级 MoE 模型 DeepSeek-V4 家族进行全参数后训练的系统优化实践,实现了 34.22% 的模型算力利用率(MFU)和 2.93 倍的性能提升,并基于此构建了面向运筹优化(OR)任务的持续预训练与微调流程,最终在零样本推理任务上达到 71.81% 的 Pass

阅读精读 →
agent
91

Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction

Athena-Brain-8B 是一个 8B 参数的大语言模型,通过多阶段后训练流水线(通用监督微调、通用强化学习、具身专家训练、模型合并),在保持通用智能的同时获得高效的高层具身交互能力,并在具身基准测试中超越多个更大规模的模型。

阅读精读 →
reasoning
95

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

这篇论文发现,前沿大语言模型在输出无意义的填充词(如点号“......”或数字序列“1,2,3,4”)时,内部其实在进行结构化的多步推理,并且这种“隐藏计算”可以通过分析残差流中的隐藏状态被直接解码出来,准确率高达80-95%。

阅读精读 →
multimodal
90

Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

这篇论文通过一个巧妙的图像替换实验(VisualSwap),揭示了当前主流视觉语言模型(VLM)在推理过程中声称“再看一眼图片”时,实际上并没有真正重新关注视觉信息,而是仅仅在生成文本模式——模型“说”自己会看,但并没有真正“看”。

阅读精读 →