Summary
Skill1 提出一个统一框架,让单一 policy 同时 co-evolve 技能的 selection、utilization、distillation 三种能力,全部学习信号都来自单一 task-outcome 信号 ——用其 low-frequency trend credit selection、high-frequency variation credit distillation——从而解决现有方法分离优化导致的 partial and conflicting evolution 问题。在 ALFWorld 上达到 97.5% success rate。
Problem & Motivation
标准 RL 把每个 task 当作 isolated episode,成功策略只隐式吸收进 policy 参数,无法在未来任务中显式复用。自然的解法是给 agent 配一个 persistent skill library,积累可复用策略。维护这样的 library 需要三个耦合能力组成的生命周期:Skill Selection(从 library 选相关技能)、Skill Utilization(执行中使用技能)、Skill Distillation(从轨迹提炼新技能)。
现有方法在两个根本问题上存在缺陷:
- 如何同时进化三种能力? 现有方法只对生命周期的子集做 policy update,至少留一个能力未优化,造成优化瓶颈。例如一个学会”用好技能”的 policy,若持续路由到 sub-optimal 技能,依然 underperform。
- 如何让三种能力朝共享目标 co-evolve? 先前设计从不同来源取 reward——一个能力拿 task-outcome reward,另一个靠 self-assessed quality 或 heuristic matching score 等 auxiliary signal。由于三者共同决定任务成败,用不一致信号优化会产生conflicting pressures。
Method
Skill1 训练单一 policy ,将三种能力统一在共享 task-outcome 目标下 co-evolve。
Agent Workflow(§3.1):对每个 task ,一条完整 trajectory 形如 ,环境返回 terminal reward 。
- Selection:policy 生成自然语言 query ,frozen encoder (all-MiniLM-L6-v2)按语义相似度检索 top- 候选 ;policy 再生成 permutation 对候选 re-rank,top-ranked 技能 进入 utilization。query 生成和 re-rank 都由 产生,因此 selection 可直接被 policy gradient 优化。
- Utilization:policy 条件于选中技能的 strategy 与环境多轮交互(最多 轮)。每个 task 独立采样 条 rollout。
- Distillation:每条 rollout 后, 反思轨迹产出可复用 strategy 和适用场景 。仅当 时才把新技能纳入 library。库满()时按 retirement score 淘汰最低者(low-utility 且不常用)。
Reward Assignment(§3.2,核心创新):三能力工作在不同时间尺度(utilization=当前 episode,selection=跨 episode 一致有效,distillation=是否超越库现有覆盖)。把单一 分解为 trend 与 variation,无需 auxiliary model 或额外 rollout:
- Utilization credit:,直接是 task outcome。
- Selection credit:两路。query 作为 rollout 前缀通过 utilization 目标拿梯度(好 query → 好候选 → 更高 );re-rank 则需反映长期技能质量,维护每技能 utility 的 EMA(,对所有 retrieved 候选更新,把 co-retrieval 视作相关性证据),用 NDCG 奖励 permutation 与 utility 排序的一致性:。这正是 low-frequency trend → selection。
- Distillation credit:理想信号是新技能能否改善未来表现,但训练时不可得。用当前 outcome 相对库 trend 的偏差近似:,其中 。正偏差表示当前经验超越库已覆盖范围、值得纳入;负偏差抑制冗余 distillation。这正是 high-frequency variation → distillation。
Joint Optimization(§3.3):每条 rollout 是四段生成(query / permutation / action / distilled skill)的拼接,各段配各自 reward,在单次梯度步用 GRPO 联合优化。total objective:。其中 re-rank 因不同 rollout 检索集不同、组内比较失效,改用 REINFORCE-style 目标独立优化。utility 非参数更新。
Key Results
实验在 ALFWorld(文本家务,多步规划+物体交互)和 WebShop(在线购物模拟)上,base model 统一为 Qwen2.5-7B-Instruct,,库容量 ≤5000,初始为空。
主结果(Table 1,Success Rate %):
- ALFWorld:Skill1 达 97.5% avg,超过 previous best RetroAgent(94.9%)2.6 点,六类任务中五类排第一(Pick 100.0、Look 98.6、Heat 99.2、Cool 96.1、Pick2 96.0;唯 Clean 略低于 RetroAgent 但差异不显著)。
- WebShop:Score 89.7 / Succ. 82.9,亦为最佳。
- 对比最强 RL-only 方法 GiGPO(90.8 avg)高 6.7 点,最大增益在 Look 和 Pick2(最受益于可复用技能组合)——说明 explicit skill library 与 parameter-only RL 互补。
- 对比 RetroAgent(utilization+distillation 用各自 intrinsic reward,但 selection 无梯度)和 SkillRL(selection 在 cold-start SFT 后 freeze),趋势清晰:性能随 co-evolution 程度上升。
Ablation(Table 2):
- 去掉整个 library:97.5→80.9%(最大降幅,Heat/Pick2 各掉 28+ 点)。
- 去掉 distillation(保留 library):降 5.1 点——无 distillation 时库存原始轨迹而非 condensed strategy,selection 更 noisy。
- 去掉 selection:降 5.7 点(即便 utilization reward 完好)——证明差的路由会 bottleneck 整个 pipeline。
- / 各降 3.5 / 2.6 点;两者都去降到 90.2%(比单独去任一更糟)——证明两个 auxiliary 信号互补且对 utilization 有超出直接目标的增益。
Co-evolution Dynamics(§4.3.2):selection precision 最先收敛(step 20 达 0.95),高质量技能供给加速另两阶段(utilization、distillation 在 step 60 达 0.8)。去任一 credit 信号会同时拖慢三能力——直接证据支持 co-evolution。
质量与多样性:task-skill similarity 从 0.51 升到 0.60;top-skill utility 到 step 85 达 0.91(ablation 落后约 0.10)。t-SNE 显示 Skill1 激活近两倍高频技能、覆盖更广策略空间(variation 信号惩罚与已有技能相似的 underperforming 技能,逼 policy 覆盖 underserved 场景)。
开销(Table 3,8×H800):Skill1 约 387–494s/step(GRPO 约 290s 的 1.3–1.7 倍),库增长到 5000。无 distillation 的变体库增长 2.4 倍、step 60 慢 69%——distillation 同时控制库质量与算力成本。
Strengths & Weaknesses
Strengths:
- 统一信号设计干净:把 selection/utilization/distillation 统一进一个 policy,用单一 的 trend/variation 频率分解做 credit assignment,无需 auxiliary model 或额外 rollout——这是 simple & principled 的设计,避免了多奖励源的 conflicting pressures。
- trend/variation 分解有概念美感:用 EMA trend 衡量”长期一致有效”(适合 selection),用相对 trend 的偏差衡量”是否超越现有边界”(适合 distillation),把时间尺度差异映射到频率分解,是本文最有 insight 的点。
- ablation 充分支撑 co-evolution claim:去任一信号同时拖慢三能力、去两个 auxiliary 比去单个能力更糟,这些都是 co-evolution 的直接实验证据,而非仅靠主结果数字。
- diversity 分析有意思:variation 信号天然带来 exploration pressure,避免库 collapse 到少数 dominant 技能。
Weaknesses:
- 环境覆盖窄:仅 ALFWorld + WebShop 两个 text-based 环境,作者自承未验证 deep search 或 visual observation 环境(这对我们关心的 GUI/computer-use agent 是关键 gap)。
- library 可扩展性是 open question:5000 容量上限,任务多样性增长时固定大小库会成瓶颈,需要更复杂的 eviction 或 hierarchical 组织。
- 依赖 binary task-outcome 信号: 在稀疏/连续奖励或难以判定成败的环境下,trend/variation 分解的有效性存疑。
- NDCG re-rank 的 ground-truth 排序来自 EMA utility,本身是 noisy 的 bootstrap:早期 utility 估计不准时 re-rank 监督可能引入偏差,论文未深入讨论这种自举的稳定性边界。
Impact:为 skill-augmented agent 的”统一进化”提供了简洁范式。其 trend/variation credit 分解思路具有一定 generalizability,可能迁移到其他需要在不同时间尺度做 credit assignment 的 lifecycle(如 memory/tool 管理)。
Mind Map
mindmap root((Skill1)) Problem Skill library 需三耦合能力 现有方法分离优化留瓶颈 多奖励源 conflicting evolution Method 单一 policy co-evolve 三能力 Workflow: query → re-rank → execute → distill 单一 task-outcome r(tau) Trend (EMA) → selection (NDCG) Variation (r-Uhat) → distillation GRPO 联合优化 Results ALFWorld 97.5% / WebShop 89.7 超 GiGPO +6.7 / RetroAgent +2.6 Ablation 证三能力 co-evolution 去任一信号同时拖慢三能力 库多样性更广不 collapse Limits 仅两个 text 环境无 visual 库容量 5000 可扩展性 依赖 binary outcome
Notes
- 与我们关心的 GUI/computer-use 方向的 gap:Skill1 明确只在 text-based 环境验证,未做 visual observation。其”单 policy 统一 selection/utilization/distillation”思路若能迁移到 GUI agent 的 skill library(如 HyMEM、UI-Mem 这类),是有价值的探索方向。
- 核心可借鉴点:trend/variation 频率分解做 credit assignment——把”长期一致有效”与”是否突破边界”两类信号从同一 outcome 中无成本地拆出,避免引入 auxiliary reward model。这对任何 self-evolving lifecycle 的 credit assignment 都有启发。
- 与 GenericAgent 的对比:GenericAgent 的 self-evolution 是 trajectory→SOP 的 one-shot crystallization(无梯度),Skill1 是 RL gradient-based co-evolution。前者轻、后者需训练但有更强的联合优化保证。两者代表 skill self-improvement 的两条不同路线。
- 待跟踪:作者提到下一步扩展到 hierarchical / multi-agent 设定,涉及 skill sharing 与 conflict resolution 的统一 credit assignment。