EMON TECH MEDIA · PAPERS — DNA·52CD39

Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

RPG(Reconstruct, Practice, Go Real)提出了一套不更新模型权重、只靠“重建—练习—上真机”闭环来自我改进机器人执行系统的框架:它从离线数据中识别可操作技能,在仿真中构造练习任务,用执行反馈和特权状态诊断失败,迭代地写出新技能、修补旧技能并改写系统提示词,最终让一个冻结的多模态大模型在 2

具身智能体自进化影响力 85.8
arXiv 2610.02204 ↗Yen-Jen Wang, Haozhe Jiang, Shuying Deng, Haoru Xue, Weirui Ye, Rocky Duan

Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

一句话概括

RPG(Reconstruct, Practice, Go Real)提出了一套不更新模型权重、只靠“重建—练习—上真机”闭环来自我改进机器人执行系统的框架:它从离线数据中识别可操作技能,在仿真中构造练习任务,用执行反馈和特权状态诊断失败,迭代地写出新技能、修补旧技能并改写系统提示词,最终让一个冻结的多模态大模型在 22 个操作任务的留出初始化上把成功率从 28.6% 提升到 95.0%,并在真机 30 次试验中全部成功。

问题背景

让机器人可靠地完成多样化操作任务,传统上代价极高:需要人写技能、设计奖励函数、把感知与控制手工对接,而且每换一个任务或环境就要重新维护。近年来大模型开始充当“调度器”,用自然语言提示词协调感知模块与底层控制策略,但这类系统通常依赖人工反复调试提示词和技能库,缺乏自主改进机制。

另一条路线是让模型在仿真中自我练习并更新权重,但权重更新成本高、易遗忘、也难保证真机迁移。RPG 的切入点是:能否在不碰模型参数的前提下,把“改进”转移到外部可复用的符号技能库和系统提示词上?这样改进过程可解释、可回滚、可跨任务复用,也更贴近工程上“冻结大模型 + 外围系统迭代”的现实约束。

方法要点

RPG 的流程可以拆成三段:

Reconstruct(重建):从离线数据集中识别出机器人已经具备哪些操作能力,并据此在仿真里构造相关的练习任务。也就是说,练习不是凭空生成,而是围绕数据中已出现的能力做有针对性的扩展。

Practice(练习):在仿真中执行这些任务,利用三类信号做失败诊断——执行反馈、仿真器特权状态(真机上拿不到的“上帝视角”信息)、以及可用的数据集视频。基于诊断结果,系统会做三件事:开发新的可复用符号技能、精炼已有技能、修改系统提示词。

Go Real(上真机):改进不是无条件接受。候选改动要先经过跨任务评估,单独测试每个候选变更,再测试合并后的修订版本,通过后才被保留进技能库和提示词。测试时,一个多模态 LLM 用最终的系统提示词和技能库来协调感知与机器人控制。

关键设计在于“改进发生在系统层而非权重层”,以及“跨任务评估作为准入门槛”,避免局部修补破坏其他任务。

关键结论(仅基于摘要可合理推断的部分;不确定处标明「摘要未给出」)

  • 在 22 个操作任务的留出初始化上,RPG 的成功率从第一轮练习后的 28.6% 提升到 15 轮后的 95.0%。
  • 对比基线中,ASPIRE 为 75.5%,由 GPT-6 Astra Pro 驱动的 CaP-Agent0 为 60.0%,RPG 均优于它们。
  • 经过统一的校准与硬件适配流程后,冻结系统在 30 次真机试验中全部成功,三个任务各 10 次。
  • 摘要未给出:22 个任务的具体清单、任务难度分布、每轮练习的样本量与耗时、失败诊断的准确率、技能库规模的增长曲线、真机试验的随机化程度与统计置信区间。
  • 摘要未给出:基线是否也做了同等轮数的练习、是否共享同一底层控制策略,因此“优于基线”的公平性细节无法从摘要判断。
  • 摘要未给出:跨任务评估的具体指标与阈值,以及被拒绝的候选改动比例。

读后思考 / 适用场景

RPG 最值得注意的不是某个数字,而是它把“自我改进”从权重空间搬到了符号与提示词空间。这带来几个实际好处:改进过程可读、可审计,出问题能定位到具体技能或提示词条目;技能库可以跨任务复用,不必为每个新任务从零调参;冻结大模型意味着可以持续换用更强的基础模型而不必重训。

适用场景上,它特别适合那些“任务族相对固定、但初始化和环境有变化”的工业或服务机器人场景,例如抓取摆放、开关门、插拔类操作。只要有可用的离线数据集和能提供特权状态的仿真器,就能搭起这套闭环。对研究而言,它提供了一个把仿真特权信息“蒸馏”成真机可用符号技能的范式。

局限与开放问题

第一,整个练习环节依赖仿真器,仿真与真机的差距(sim-to-real gap)是隐含风险。摘要说真机 30 次全成功,但样本量小、任务数只有三个,泛化性仍需更大规模验证。

第二,诊断依赖“特权状态”,这类信息真机上没有,如何保证诊断出的技能在真机同样有效,摘要未给出机制细节。

第三,技能库和提示词会随轮数增长,长期是否会膨胀、冲突或退化,摘要未给出。95.0% 是 15 轮后的结果,是否已饱和、继续练会不会过拟合,也是开放问题。

第四,对比基线的公平性、任务难度分布、失败案例类型,摘要都未交代,读者难以判断提升幅度的真实含金量。真机“全部成功”是否因为任务被挑选得较容易,也需要原文补充。

总体而言,RPG 指出了一个有前景的方向:不改权重,也能让机器人系统越练越强。但它离“通用自主改进”还有距离,尤其在仿真依赖、真机泛化和技能库长期健康度这三方面。

本页为科普精读;细节以 arXiv 原文为准。就本篇提问请点左下角「论文研读助手」。