Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design
一句话概括
这篇论文提出 Designer-RSI,让一个权重冻结的前沿大模型通过 230 多个工具操作专业设计软件,并把从真实用户流量中积累的自然语言「程序性记忆」当作可增可改的技能库,在没有任何权重更新和人工标注的条件下,把设计代理的执行成功率从 72.7% 提升到 99.3%。
问题背景
专业平面设计是一类典型的「长程代理任务」:最终产物是一份结构化、可继续编辑的设计文件,而它由大量相互依赖的操作逐步堆叠而成。这类任务有两个让自动化特别棘手的性质。
第一,它没有可靠的程序化判分器。写代码可以跑单元测试,数学题可以对答案,但一张海报「好不好」很难用一个函数判定。第二,它的反馈是嘈杂且不可验证的:用户可能只是没抱怨,不代表设计合格;一次执行没报错,也不代表产物可用。在这种环境下,靠强化学习去更新模型权重既昂贵又容易被噪声带偏。
作者选择的路线是:不动模型权重,转而维护一份外部的、用自然语言写成的「程序性记忆」——把可复用的设计流程沉淀成技能条目,让冻结的模型在需要时调用。这相当于把「学习」从参数空间搬到了上下文空间。
方法要点
框架由三部分组成。
冻结的执行者:一个前沿模型通过 230 多个工具操作专业设计软件,本身不做任何微调。
可增长、可加深的记忆库:记忆以自然语言技能的形式存在。所谓「拓宽」(widening),是当代理反复遇到某个未被现有技能覆盖的子任务时,为它新增一条程序;所谓「加深」(deepening),是拿已有技能去对照它自己成功和失败的执行记录,据此修订这条技能本身。初始技能库来自文档,共 76 条。
匹配重放门控(matched replay gate):这是防止记忆退化的关键机制。任何对记忆的修改,都必须同时通过两类检验——修好了原本失败的案例,且没有让原本成功的案例变差。只有满足这个条件的改动才被接纳。
整个流程在 1,406 份真实用户需求简报上迭代五轮,产生 1,869 条自动评分的执行轨迹,全程无权重更新、无人工标签。
关键结论(仅基于摘要可合理推断的部分;不确定处标明「摘要未给出」)
- 五轮迭代后,技能库从 76 条文档衍生技能增长到 139 条。
- 在 Claude-Sonnet-4 上,GenEval2 执行成功率从 72.7% 升至 99.3%,生成质量提升 11.99 个百分点。
- 在四个专业设计基准上,相对无技能代理的胜率分别为 61.8%(Claude-Sonnet-4)和 67.6%(Claude-Opus-4.6)。
- 两种机制需要配合使用:在用户流量基准的 200 份留出简报上,单独拓宽或单独加深的胜率分别是 49.4% 和 48.6%,二者结合达到 58.5%(p = 0.025)。
- 摘要未给出:技能条目的平均长度、单条技能的复用频次、五轮迭代中每轮的具体增益曲线、失败案例的类型分布,以及「自动评分」所依据的具体判据。摘要也未说明 99.3% 与 72.7% 是否在同一批简报上测得,还是分别对应不同评测集。
读后思考 / 适用场景
这篇工作最值得注意的地方,是它把「持续适应」这件事从权重空间解耦出来。在那些反馈嘈杂、没有可靠 oracle 的领域——设计、写作、剪辑、复杂业务操作——梯度更新往往既不可行也不划算,而一份可审计、可回滚、可人工干预的自然语言技能库,反而更贴近工程现实。匹配重放门控这个设计尤其务实:它把「不要越改越差」这条朴素的工程直觉,变成了一个可执行的准入条件。
适用场景上,凡是满足「有大量真实用户请求 + 有专业软件工具链 + 结果难以自动判分」这三个条件的代理任务,都可以考虑这套思路。它天然适合作为产品侧的持续优化层,而不是训练侧的方案。
局限与开放问题
首先,摘要中的评测依赖「自动评分」,但在一个明确承认「没有可靠程序化 oracle」的领域里,自动评分的可信度本身就是一个需要交代的问题——摘要未给出评分器的构造方式与验证结果。
其次,胜率数字(61.8%、67.6%)相对无技能基线而言,缺少与「人工撰写技能库」或「更强基线代理」的对比,因此难以判断增益中有多少来自记忆机制本身,多少只是来自更多的上下文提示。
第三,记忆库增长到 139 条之后是否会出现检索冲突、条目冗余或相互矛盾的技能,摘要未给出。随着轮次继续增加,匹配重放门控能否持续拦住退化,也是一个开放问题。
最后,这套方法高度依赖底层模型的能力上限。当冻结模型本身无法完成某个子任务时,记忆层能做的只是把流程写清楚,而无法补上能力缺口——这条边界在哪里,值得进一步刻画。