Summary

MGA 把长程 GUI 任务从”拼接整条原始轨迹”重构为一串独立决策节点:每步只喂给 planner 三样东西——当前截图 I_t、一个 task-agnostic 的结构化观测 Z_t、以及一条经过验证的增量记忆链 M_{t-1},用”先客观观察、再增量记忆”替代 raw-trajectory 上下文堆叠。在 OSWorld 上 MGA w/ GPT-5 取得 64.7% 平均(略高于 OS-Symphony 的 63.6%),且 total token 仅为其约 38%。

Problem & Motivation

作者指出长程 GUI agent 有两个瓶颈:(1) 主流方法把任务建模成 flat sequential trajectory,把历史截图、plan、action 全部 concat 进 context,迫使模型从整条原始轨迹推断当前状态,导致 attention dilution 与 error accumulation;(2) SOTA 框架(OS-Symphony、Agent S3)堆叠 orchestrator、reflection、tool chain 等多个 expert module,对多数常规 GUI 任务是 over-design。MGA 的 first-principles 主张是:observation 与 memory 的融合足以充分表征潜在 GUI 状态,因此不需要冗长轨迹也不需要庞大的专家模块群。

Method

四个级联 agent 构成 perception→decision→execution→memory 闭环,环境状态形式化为 E_t = (I_t, Z_t, M_{t-1})

  • Observation Agent(观察先行、意图无关):把感知与决策解耦。它被”严格禁止做任何 planning / intent inference”,只做客观、细粒度的状态刻画,输出 Z_t = ⟨W_t, T_t, S_t⟩:窗口拓扑 W_t(窗口语义标识、前景焦点布尔、modal/overlay 约束)、可见语义内容 T_t(穷举屏幕全部可见文本 + 其 UI 功能类别,含 non-actionable 的只读文本/背景状态)、动态交互状态 S_t(键盘焦点、选区、滚动位置、瞬态 overlay)。目的:消除 planner 因”action bias”只盯可点击元素、忽略背景语义所带来的 confirmation bias 与 visual hallucination。实现上用 Qwen-2.5-VL-7b 在 GUICourse 上微调。
  • Memory Agent(验证门控的增量记忆):不保留原始轨迹,而是 M_t = 𝓜(M_{t-1}, a_{t-1}, I_{t-1}, I_t) = ⟨V_t, H_t, E_t⟩。① Dual-Frame Visual Validation V_t:对比动作前后两帧截图,输出 {Success, Failure, Uncertain},只有目标元素发生真实视觉变化才判 Success,Failure 时显式抽出”未变化的元素”以物理阻断 action hallucination;② Append-Only State Transition Chain H_t = H_{t-1} ⊕ ⟨a_{t-1}, V_t, ΔS_t⟩:只沉淀被验证过的状态增量 ΔS_t,用结构化高层摘要替代 raw trajectory;③ Anomaly Interceptor E_t:Pattern Monitor 检测 Repeated Error(同目标失败动作重复)与 Stagnant State(界面 ≥N 步不变),触发 hard error alert 直接注入下一步 planning prompt,强行打断行为惯性。
  • Planning Agent:严格 step-wise,仅在 compact tuple ⟨th_t, A_t⟩ = 𝓟(Ins, I_t, Z_t, M_{t-1}) 上决策,不 replay 整条历史;动作空间含原子 GUI 操作 + on-the-fly Python code action。
  • GUI Grounding Agent:用 UI-TARS 把 planner 的自然语言动作落成坐标/元素级操作(pyautogui)。MGA w/ GPT-5 配置为 GPT-5 planner + Qwen3-8B memory(成本考量)。

如何避免 raw-trajectory 过载:核心是把”上下文 = 全历史拼接”换成”上下文 = 经验证的紧凑事实链”。planner 每步的输入长度由 Z_t(当前帧结构化摘要)+ M_{t-1}(增量链)决定,而非随步数线性增长的原始截图/动作序列;验证门控保证只有真实发生的状态变化进入记忆。

Key Results

在 OSWorld(369 任务,rule-based evaluator)上,表格数值论文称为 “grounding accuracy”(与 OSWorld 的 task success 同一量,Table 2 又记为 SR):

  • 总体(Table 1,50 步):MGA w/ GPT-5 = 64.7%,高于 OS-SYMPHONY w/ GPT-5(63.6%)、GTA1-7b w/ GPT-5(61.0%)、CoAct-1 w/ GPT-5 @150 步(60.8%);MGA w/ o3 = 52.9%。
  • 分域(MGA w/ GPT-5,50 步):OS 87.5%(CoAct-1 需 150 步才到 75.0%)、Professional 85.4%(> GTA1-7b w/ o3 的 77.6%)、Daily 64.4%、Office 64.7%(≈ OS-Symphony 64.9%);Workflow 仅 47.7%,落后 OS-Symphony 的 54.9%
  • Memory 质量决定上限(Table 2,Workflow 50 步):把 memory 从 Qwen3-8B 换成 GPT-5,Workflow SR 47.7%→56.3%,反超 OS-Symphony(54.9%);成本 $15/task(Qwen3 memory)与 $64/task(GPT-5 memory)分别约为 OS-Symphony($150,54.9%)的 10% 与 43%。作者据此论证:性能差异主要来自 memory 抽象质量,而非架构复杂度。
  • 核心组件 ablation(Table 3,Workflow,GPT-5 / o3):Full 56.3 / 36.4;w/o obs 46.0 / 35.1;w/o memory 39.0 / 27.7;w/o both 36.8 / 15.8——memory 去除跌幅最大,两者高度协同。
  • 效率(Appendix C / Table 6):MGA 平均执行步数 19.3 > OS-Symphony 15.2,但因每步 prompt 经蒸馏压缩,total token 226.1K ≈ OS-Symphony 598.6K 的 38%;token 开销中 Memory 模块占 42.6%,Observer 稳定约 45.6K。

Evidence Ledger

Claim IDClaimTypeSource locatorEvidence excerptStatus
C1MGA w/ GPT-5 OSWorld 总体 64.7%,高于 OS-Symphony 63.6% / GTA1-7b 61.0% / CoAct-1@150 60.8%comparisonTable 1; Sec 4.4”MGA w/ GPT-5 … 64.7”; “outperforms OS-Symphony (63.6%) … GTA1-7b (61.0%) … CoAct-1 (60.8%) with 150 steps”source-verified
C2OS 域 87.5% @50步,超 CoAct-1(75.0%,用到150步)comparisonTable 1; Sec 4.4”MGA w/ GPT-5 achieves 87.5% … CoAct-1 requires 150 steps to reach its peak”source-verified
C3Professional 85.4% > GTA1-7b w/ o3 77.6%comparisonTable 1”MGA w/ GPT-5 … 85.4”; “GTA1-7b w/ o3 … 77.6”source-verified
C4头部配置 Workflow 47.7% 落后 OS-Symphony 54.9%comparisonTable 1; Sec 4.4”MGA w/ GPT-5 achieves 47.7%. Although it trails OS-Symphony (54.9%)“source-verified
C5memory 升级为 GPT-5 后 Workflow 56.3% 反超,$64 vs OS-Symphony $150;Qwen3 memory $15@47.7%comparisonTable 2; Sec 4.5.1”MGA achieves a 56.3% success rate at a cost of $64 … OS-Symphony requires $150 … 54.9%“source-verified
C6Ablation Full 56.3/36.4;w/o obs 46.0/35.1;w/o memory 39.0/27.7;w/o both 36.8/15.8numberTable 3”MGA (Full) 56.3 | 36.4 … w/o memory 39.0 | 27.7 … w/o obs+memory 36.8 | 15.8”source-verified
C7步数 19.3 > 15.2,但 token 226.1K ≈ OS-Symphony 598.6K 的 38%numberAppendix C; Table 6”average execution step count (19.3) is higher than OS-Symphony (15.2) … only approximately 38% of … (598.6K)“source-verified
C8双帧前后视觉验证 {Success,Failure,Uncertain},仅存验证过的增量 ΔS_t,append-only 非原始轨迹causal-mechanismSec 3.3”Dual Frame Visual Validation … {Success,Failure,Uncertain}”; “deposits only the validated state increments (ΔS_t) … replaces raw trajectories”source-verified
C9MGA w/ GPT-5 = GPT-5 planner + Qwen3-8B memory;Observer=Qwen-2.5-VL-7b(GUICourse 微调);grounding=UI-TARSbenchmark-settingSec 4.2”GPT-5 as the Planner and qwen3-8b as the Memory Agent … Qwen-2.5-VL-7b … GUICourse … Grounding agent adopts UI-TARS”source-verified
C10OSWorld 369 任务,rule-based evaluator(134 atomic predicates)benchmark-settingSec 4.1/4.2”It contains 369 tasks”; “134 handcrafted atomic execution-based predicates”source-verified

Strengths & Weaknesses

亮点:① thesis 干净且可证伪——“observation + validated memory 足以表征 GUI 状态”,并用 ablation(去 memory 跌 17pt、去 obs 跌 10pt、去两者跌 20pt)直接支撑;② dual-frame validation 把”动作是否留下可验证的状态变化”作为记忆写入的硬门控,是对 action hallucination 的机制级(而非提示级)拦截,且顺带产出 anomaly/loop 信号;③ 效率论证扎实:用更多步数换更低单步 token,total token 仅 38%,Pareto 前沿论证成立;④ memory-swap 消融(Qwen3-8B→GPT-5,47.7→56.3)把”性能来自 memory 抽象质量而非架构复杂度”这一 claim 做成了受控实验,比单纯的组件 on/off 更有说服力。

局限/需警惕:① 头部 SOTA 的配置混淆——64.7% overall 用的是 GPT-5 planner + Qwen3-8B memory,超 OS-Symphony 仅 1.1pt;而在该配置下 Workflow(最难域,27.4% 任务)反而落后(47.7 vs 54.9),只有把 memory 换成 GPT-5 才反超(56.3),但该全 GPT-5 配置的 overall 平均没有报告,无法确认其总体是否仍 SOTA 或提升多少。② 术语不一致:表格标 “grounding accuracy” 而实际是 OSWorld task success(Table 2 又叫 SR),易误读。③ 全为单次结果,无 seed/方差/置信区间,1pt 级差距的稳健性存疑;baseline 步数预算不齐(50/100/150 混比),比较口径不完全对等。④ 作者自陈边界:弱 memory 模型(Qwen3-8B)在长程 intent retention、里程碑抽取、隐式 error tracing 上能力受限,导致 trajectory summarization 的信息压缩损失与 intent 语义漂移;复杂 grounding 仍受底座 MLLM 能力天花板约束;minimalist 设计需更多探索步数。⑤ 仅在 OSWorld(Ubuntu 桌面)验证,“real-world applications” 只在 Appendix case study 定性呈现,跨平台泛化未量化。⑥ 尚为投稿稿(ACM MM 2026),正文残留 ACM 模板占位(Woodstock/2018),非 camera-ready。

对领域的意义:为”context construction 而非模型/编排堆叠”提供了一个可复现的极简蓝本——把上下文从”全历史拼接”降为”验证过的事实增量链”,并把 perception 拆成 intent-free 的独立读屏。它是 memory/observation 作为 GUI agent state representation 的一个有力数据点,但其”SOTA”叙事对配置选择敏感,引用时应锚定具体配置而非笼统的 64.7%。

Mind Map

mindmap
  root((MGA))
    Problem
      raw-trajectory context overload
      attention dilution & error accumulation
      over-designed multi-agent redundancy
    Method
      Observe-first Z_t=(W,T,S) intent-free
      Memory M_t=(V,H,E) validated deltas
      dual-frame Success/Failure/Uncertain
      append-only ΔS chain + anomaly interceptor
      step-wise planner on compact tuple
    Results
      OSWorld 64.7% overall (GPT-5 planner)
      OS 87.5% / Prof 85.4% @50 steps
      Workflow 47.7% (headline) → 56.3% (GPT-5 memory)
      token 226.1K ≈ 38% of OS-Symphony
      ablation: memory > observation

Notes

  • 与 thesis 的关系:MGA 是”action 必须回溯到 belief source(pixels I_t / structure Z_t / memory M_{t-1}),并留下可验证 state change”的一个正面实例——dual-frame validation 恰恰把”目标元素发生真实视觉变化”作为记忆写入的必要条件(Success 判据),把 verifiable state change 制度化。但它也印证 thesis 的反面警告:hybrid observation 会放大 stale evidence——append-only 链一旦把错误/Uncertain 状态当作事实沉淀(弱 memory 模型下的 intent 语义漂移即为此类),后续 planner 会持续被过期证据误导;MGA 用 anomaly interceptor 事后打断 loop,属补救而非根除。
  • 可对照 vault 内 2500-ChainMemoryEnhancingGui2409-AgentWorkflowMemory2603-HybridMemory 看”GUI/agent memory 表示”的谱系差异:MGA 的差异化在于 validation-gated 写入 + intent-free 观察前置。
  • 存疑待查:全 GPT-5(planner+memory)配置的 OSWorld overall 到底是多少?论文只给了 Workflow 单域(56.3),未报总体,是评价其真实 SOTA 幅度的关键缺口。