Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents
一句话概括
RPG(Reconstruct, Practice, Go Real)提出了一套不更新模型权重、只靠“重建—练习—上真机”闭环来自我改进机器人执行系统的框架:它从离线数据中识别可操作技能,在仿真中构造练习任务,用执行反馈和特权状态诊断失败,迭代地写出新技能、修补旧技能并改写系统提示词,最终让一个冻结的多模态大模型在 22 个操作任务的留出初始化上把成功率从 28.6% 提升到 95.0%,并在真机 30 次试验中全部成功。
问题背景
让机器人可靠地完成多样化操作任务,传统上代价极高:需要人写技能、设计奖励函数、把感知与控制手工对接,而且每换一个任务或环境就要重新维护。近年来大模型开始充当“调度器”,用自然语言提示词协调感知模块与底层控制策略,但这类系统通常依赖人工反复调试提示词和技能库,缺乏自主改进机制。
另一条路线是让模型在仿真中自我练习并更新权重,但权重更新成本高、易遗忘、也难保证真机迁移。RPG 的切入点是:能否在不碰模型参数的前提下,把“改进”转移到外部可复用的符号技能库和系统提示词上?这样改进过程可解释、可回滚、可跨任务复用,也更贴近工程上“冻结大模型 + 外围系统迭代”的现实约束。
方法要点
RPG 的流程可以拆成三段:
Reconstruct(重建):从离线数据集中识别出机器人已经具备哪些操作能力,并据此在仿真里构造相关的练习任务。也就是说,练习不是凭空生成,而是围绕数据中已出现的能力做有针对性的扩展。
Practice(练习):在仿真中执行这些任务,利用三类信号做失败诊断——执行反馈、仿真器特权状态(真机上拿不到的“上帝视角”信息)、以及可用的数据集视频。基于诊断结果,系统会做三件事:开发新的可复用符号技能、精炼已有技能、修改系统提示词。
Go Real(上真机):改进不是无条件接受。候选改动要先经过跨任务评估,单独测试每个候选变更,再测试合并后的修订版本,通过后才被保留进技能库和提示词。测试时,一个多模态 LLM 用最终的系统提示词和技能库来协调感知与机器人控制。
关键设计在于“改进发生在系统层而非权重层”,以及“跨任务评估作为准入门槛”,避免局部修补破坏其他任务。
关键结论(仅基于摘要可合理推断的部分;不确定处标明「摘要未给出」)
- 在 22 个操作任务的留出初始化上,RPG 的成功率从第一轮练习后的 28.6% 提升到 15 轮后的 95.0%。
- 对比基线中,ASPIRE 为 75.5%,由 GPT-6 Astra Pro 驱动的 CaP-Agent0 为 60.0%,RPG 均优于它们。
- 经过统一的校准与硬件适配流程后,冻结系统在 30 次真机试验中全部成功,三个任务各 10 次。
- 摘要未给出:22 个任务的具体清单、任务难度分布、每轮练习的样本量与耗时、失败诊断的准确率、技能库规模的增长曲线、真机试验的随机化程度与统计置信区间。
- 摘要未给出:基线是否也做了同等轮数的练习、是否共享同一底层控制策略,因此“优于基线”的公平性细节无法从摘要判断。
- 摘要未给出:跨任务评估的具体指标与阈值,以及被拒绝的候选改动比例。
读后思考 / 适用场景
RPG 最值得注意的不是某个数字,而是它把“自我改进”从权重空间搬到了符号与提示词空间。这带来几个实际好处:改进过程可读、可审计,出问题能定位到具体技能或提示词条目;技能库可以跨任务复用,不必为每个新任务从零调参;冻结大模型意味着可以持续换用更强的基础模型而不必重训。
适用场景上,它特别适合那些“任务族相对固定、但初始化和环境有变化”的工业或服务机器人场景,例如抓取摆放、开关门、插拔类操作。只要有可用的离线数据集和能提供特权状态的仿真器,就能搭起这套闭环。对研究而言,它提供了一个把仿真特权信息“蒸馏”成真机可用符号技能的范式。
局限与开放问题
第一,整个练习环节依赖仿真器,仿真与真机的差距(sim-to-real gap)是隐含风险。摘要说真机 30 次全成功,但样本量小、任务数只有三个,泛化性仍需更大规模验证。
第二,诊断依赖“特权状态”,这类信息真机上没有,如何保证诊断出的技能在真机同样有效,摘要未给出机制细节。
第三,技能库和提示词会随轮数增长,长期是否会膨胀、冲突或退化,摘要未给出。95.0% 是 15 轮后的结果,是否已饱和、继续练会不会过拟合,也是开放问题。
第四,对比基线的公平性、任务难度分布、失败案例类型,摘要都未交代,读者难以判断提升幅度的真实含金量。真机“全部成功”是否因为任务被挑选得较容易,也需要原文补充。
总体而言,RPG 指出了一个有前景的方向:不改权重,也能让机器人系统越练越强。但它离“通用自主改进”还有距离,尤其在仿真依赖、真机泛化和技能库长期健康度这三方面。