DeepRead
Search
Search
Dark mode
Light mode
Explorer
Popular Tags
#VLM
#agentic-RL
#gui-agent
#web-agent
#LLM
#VLA
#computer-use
#task-planning
#manipulation
#imitation-learning
Home
❯
Papers
Folder: Papers
1059 items under this folder.
Aug 20, 2026
Archive
Aug 20, 2026
Principles of Mixed-Initiative User Interfaces
gui-agent
hci
Aug 20, 2026
Humans and Automation: Use, Misuse, Disuse, Abuse
gui-agent
hci
safety
Aug 20, 2026
Quo Vadis, World Modeling? Towards Interactive World Proxies for Continually Improving Agents
world-model
agentic-RL
task-planning
Aug 20, 2026
WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
world-model
spatial-reasoning
VLM
Aug 20, 2026
How Should Vision-Language-Action Models Use Proprioceptive State?
VLA
manipulation
flow-matching
Aug 20, 2026
UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations
computer-use
gui-agent
agentic-RL
Aug 20, 2026
StepReflect: Structured UI Transition Reflection for Mobile GUI Agents
gui-agent
agentic-RL
Aug 20, 2026
SkillJack: Persistent Skill Backdoors in Self-Evolving Agents
agentic-RL
task-planning
LLM
Aug 20, 2026
Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
computer-use
gui-agent
agentic-RL
Aug 20, 2026
RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States
agentic-RL
LLM
Aug 20, 2026
Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation
gui-agent
agentic-RL
Aug 20, 2026
Qwen-CUA: Native Computer Use for (almost) Everything
computer-use
gui-agent
agentic-RL
Aug 20, 2026
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
agentic-RL
LLM
Aug 20, 2026
Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
agentic-RL
LLM
computer-use
Aug 20, 2026
MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight
world-model
mobile-manipulation
VLA
Aug 20, 2026
MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models
gui-agent
VLM
Aug 20, 2026
When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents
spatial-memory
VLM
Aug 20, 2026
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
computer-use
task-planning
gui-agent
Aug 20, 2026
Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents
computer-use
gui-agent
hci
Aug 20, 2026
In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use
VLA
embodied-reasoning
manipulation
Aug 20, 2026
The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents
gui-agent
agentic-RL
Aug 20, 2026
GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs
gui-agent
VLM
computer-use
Aug 20, 2026
Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models
VLA
instruction-following
manipulation
Aug 20, 2026
EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents
agentic-RL
task-planning
LLM
Aug 20, 2026
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
agentic-RL
world-model
Aug 20, 2026
DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model
world-model
LLM
Aug 20, 2026
DarwinX: Evolving Agent Harnesses Through Natural Selection
task-planning
gui-agent
web-agent
Aug 20, 2026
ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?
agentic-RL
task-planning
LLM
Aug 20, 2026
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
agentic-RL
RL
LLM
Aug 20, 2026
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
world-model
manipulation
imitation-learning
Aug 20, 2026
CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention
VLA
manipulation
flow-matching
Aug 20, 2026
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
world-model
manipulation
flow-matching
Aug 20, 2026
Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning
manipulation
VLA
RL
Aug 20, 2026
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
agentic-RL
LLM
Aug 20, 2026
Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
mobile-manipulation
agentic-RL
instruction-following
Aug 20, 2026
AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents
gui-agent
world-model
agentic-RL
Aug 20, 2026
A New Role for Relevance: Guiding Corpus Interaction in Agentic Search
deep-research
Aug 20, 2026
AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?
agentic-RL
LLM
Aug 20, 2026
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
gui-agent
computer-use
agentic-RL
Aug 20, 2026
QQWorld: Quantile-Quantile Matching for World Model Regularization
world-model
RL
Aug 20, 2026
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
deep-research
agentic-RL
Aug 20, 2026
Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI
LLM
agentic-RL
Aug 20, 2026
Zero-Mem: Zero-Token Memory Operations for LLM Agents
LLM
Aug 20, 2026
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
VLA
mobile-manipulation
cross-embodiment
Aug 20, 2026
Is Progressive Disclosure All You Need for Long-Context Agents?
LLM
task-planning
Aug 20, 2026
Plover: Steering GUI Agents through Plan-Centric Interaction
gui-agent
task-planning
instruction-following
Aug 20, 2026
From Pixels to States: Rethinking Interactive World Models as Game Engines
world-model
Aug 20, 2026
World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models
world-model
task-planning
manipulation
Aug 20, 2026
PhiZero: A World Model Built Around Physical Language
world-model
embodied-reasoning
cross-embodiment
Aug 20, 2026
PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning
agentic-RL
task-planning
Aug 20, 2026
Wonder: Video World Model Done Better
world-model
Aug 20, 2026
AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning
agentic-RL
Aug 20, 2026
Object-Centric Environment Modeling for Agentic Tasks
world-model
task-planning
Aug 20, 2026
ACC: Compiling Agent Trajectories for Long-Context Training
agentic-RL
LLM
Aug 20, 2026
A11y-Compressor: A Framework for Enhancing the Efficiency of GUI Agent Observations through Visual Context Reconstruction and Redundancy Reduction
gui-agent
computer-use
Aug 20, 2026
dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model
world-model
robotics
policy-evaluation
diffusion
Aug 20, 2026
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
world-model
video-generation
RL
3D-consistency
Aug 20, 2026
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
VLA
RL
world-model
Aug 20, 2026
World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
VLM
world-model
spatial-reasoning
Aug 20, 2026
WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments
gui-agent
computer-use
task-planning
Aug 20, 2026
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
computer-use
gui-agent
agentic-RL
Aug 20, 2026
WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark
gui-agent
web-agent
Aug 20, 2026
Visual Access Boundaries in Vision-Language Model Reasoning
VLM
Aug 20, 2026
Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling
world-model
VLM
agentic-RL
Aug 20, 2026
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
web-agent
LLM
Aug 20, 2026
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
video-understanding
video-LLM
VLM
Aug 20, 2026
VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
VLA
manipulation
flow-matching
Aug 20, 2026
UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
gui-agent
agentic-RL
computer-use
Aug 20, 2026
N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
VLA
manipulation
RL
Aug 20, 2026
Untrusted Content Masking for Web Agents with Security Guarantees
web-agent
gui-agent
Aug 20, 2026
Watch Before You Answer: Learning from Visually Grounded Post-Training
video-LLM
video-understanding
agentic-RL
Aug 20, 2026
N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
world-model
manipulation
flow-matching
Aug 20, 2026
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
VLA
manipulation
imitation-learning
Aug 20, 2026
Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction
gui-agent
agentic-RL
Aug 20, 2026
Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms
VLA
Aug 20, 2026
When Does Muon Help Agentic Reinforcement Learning?
agentic-RL
RL
Aug 20, 2026
ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
agentic-RL
LLM
Aug 20, 2026
VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation
gui-agent
computer-use
00FF00
Aug 20, 2026
Tube Diffusion Policy: Reactive Visual-Tactile Policy Learning for Contact-rich Manipulation
diffusion-policy
world-model
manipulation
tactile
Aug 20, 2026
Teach it to stop, not just to click
computer-use
agentic-RL
gui-agent
Aug 20, 2026
How Benchmarks Mis-Score Computer-Use Agents
computer-use
gui-agent
web-agent
benchmark
evaluation
LLM
Aug 20, 2026
TACTILE: Giving Computer-Using Agents Hands and Feet
computer-use
gui-agent
Aug 20, 2026
The Tool Illusion: Rethinking Tool Use in Web Agents
web-agent
gui-agent
task-planning
Aug 20, 2026
A Task-State Representation for Long-Horizon Mobile GUI Agents
gui-agent
task-planning
Aug 20, 2026
Learning to Move Before Learning to Do: Task-Agnostic Pretraining for VLAs
imitation-learning
VLA
Aug 20, 2026
MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution
agentic-RL
LLM
task-planning
Aug 20, 2026
SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
VLM
Aug 20, 2026
Step-level Optimization for Efficient Computer-use Agents
computer-use
gui-agent
agentic-RL
Aug 20, 2026
StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
computer-use
gui-agent
task-planning
Aug 20, 2026
SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments
spatial-reasoning
agentic-RL
VLM
Aug 20, 2026
2604-SnapGuard
PromptInjection
WebAgent
Security
ScreenshotBased
VLM
Detection
Lightweight
Aug 20, 2026
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
agentic-RL
LLM
RL
Aug 20, 2026
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
VLM
RL
Aug 20, 2026
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
LLM
task-planning
Aug 20, 2026
SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation
VLA
flow-matching
manipulation
Aug 20, 2026
SKILL-KD: Contrastive Skill Distillation for LLM Agents
task-planning
LLM
agentic-RL
Aug 20, 2026
Sidekick: Designing Communication for Effective Multitasking with Computer Use Agents
computer-use
gui-agent
Aug 20, 2026
SkillFlow: Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents
task-planning
LLM
Skills
Aug 20, 2026
SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
gui-agent
world-model
Aug 20, 2026
Mental World Modeling
world-model
LLM
VLM
Aug 20, 2026
SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents
computer-use
agentic-RL
Aug 20, 2026
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
web-agent
task-planning
LLM
Aug 20, 2026
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
VLM
agentic-RL
web-agent
Aug 20, 2026
SkillClaw: Let Skills Evolve Collectively with Agentic Evolver
computer-use
task-planning
LLM
Aug 20, 2026
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
video-LLM
video-understanding
VLM
Aug 20, 2026
Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents
LLM
instruction-following
Aug 20, 2026
Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
LLM
gui-agent
VLM
Aug 20, 2026
Skill0: In-Context Agentic Reinforcement Learning for Skill Internalization
agentic-RL
task-planning
LLM
Aug 20, 2026
SketchVLM: Vision language models can annotate images to explain thoughts and guide users
VLM
visual-reasoning
explainability
Aug 20, 2026
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
world-model
manipulation
VLA
Aug 20, 2026
STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation
world-model
VLA
manipulation
diffusion-policy
Aug 20, 2026
SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning for GUI Agents
RL
gui-agent
credit-assignment
long-horizon
Aug 20, 2026
MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems
agentic-RL
LLM
task-planning
Aug 20, 2026
Recursive Multi-Agent Systems
LLM
agentic-RL
Aug 20, 2026
Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember
agentic-RL
deep-research
task-planning
Aug 20, 2026
Read More, Think More: Revisiting Observation Reduction for Web Agents
web-agent
gui-agent
Aug 20, 2026
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
agentic-RL
LLM
task-planning
Aug 20, 2026
SEE: Structure-aware Exploring & Exploiting for Long-horizon GUI Agent Trajectory Synthesis
gui-agent
task-planning
Aug 20, 2026
MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation
gui-agent
agentic-RL
computer-use
Aug 20, 2026
See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles
gui-agent
computer-use
VLM
Aug 20, 2026
Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation
diffusion-policy
manipulation
imitation-learning
Aug 20, 2026
See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
VLM
Aug 20, 2026
MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation
web-agent
agentic-RL
gui-agent
Aug 20, 2026
Self-Evolving Agents with Anytime-Valid Certificates
agentic-RL
task-planning
Aug 20, 2026
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
agentic-RL
LLM
Aug 20, 2026
SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
web-agent
task-planning
LLM
Aug 20, 2026
GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
gui-agent
agentic-RL
computer-use
Aug 20, 2026
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
computer-use
task-planning
Aug 20, 2026
SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL
computer-use
agentic-RL
gui-agent
Aug 20, 2026
SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System
video-understanding
task-planning
video-LLM
Aug 20, 2026
On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation
VLA
manipulation
flow-matching
Aug 20, 2026
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
VLA
manipulation
diffusion-policy
Aug 20, 2026
Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
video-understanding
VLM
video-LLM
Aug 20, 2026
KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
gui-agent
computer-use
task-planning
Aug 20, 2026
Scaling Spatial Intelligence with Multimodal Foundation Models
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
RAGEN-2: Reasoning Collapse in Agentic RL
agentic-RL
RL
LLM
Aug 20, 2026
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
spatial-reasoning
VLM
scene-understanding
Aug 20, 2026
SWE-Explore: Benchmarking How Coding Agents Explore Repositories
gui-agent
LLM
Aug 20, 2026
Kimi K3: Open Frontier Intelligence
LLM
agentic-RL
VLM
Aug 20, 2026
π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
VLA
manipulation
cross-embodiment
Aug 20, 2026
SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
video-LLM
video-understanding
VLM
Aug 20, 2026
Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification
gui-agent
computer-use
agentic-RL
Aug 20, 2026
Speculative Rollback Correction for Quality-Diverse Web Agent Imitation
web-agent
imitation-learning
gui-agent
Aug 20, 2026
Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis
agentic-RL
deep-research
LLM
Aug 20, 2026
ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes
auto-research
LLM
Aug 20, 2026
SAGE: Scalable Agentic 3D Scene Generation for Embodied AI
3D-representation
embodied-reasoning
mobile-manipulation
Aug 20, 2026
HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents
gui-agent
agentic-RL
Aug 20, 2026
Privileged Foresight Distillation: Zero-Cost Future Correction for World Action Models
world-model
VLA
manipulation
Aug 20, 2026
S2-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
spatial-reasoning
VLM
scene-understanding
Aug 20, 2026
Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning
agentic-RL
VLM
Aug 20, 2026
OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Dynamics-Aware Preference Optimization for Vision-Language Models
VLM
RL
Aug 20, 2026
Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training
agentic-RL
LLM
Aug 20, 2026
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
imitation-learning
VLA
manipulation
Aug 20, 2026
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
LLM
task-planning
Aug 20, 2026
DualMirage: Hunting Stealthy Multimodal LLM Agents via CAPTCHAs with Contour and Adversarial Illusions
web-agent
VLM
gui-agent
Aug 20, 2026
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
gui-agent
computer-use
Aug 20, 2026
RhinoVLA Technical Report
VLA
cross-embodiment
flow-matching
manipulation
Aug 20, 2026
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
web-agent
computer-use
gui-agent
Aug 20, 2026
Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual–Inertial Odometry
SLAM
navigation
RL
Aug 20, 2026
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
world-model
video-understanding
manipulation
Aug 20, 2026
Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality
LLM
task-planning
Aug 20, 2026
RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
agentic-RL
VLM
instruction-following
Aug 20, 2026
MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
VLM
Aug 20, 2026
Dockerless: Environment-Free Program Verifier for Coding Agents
agentic-RL
LLM
auto-research
Aug 20, 2026
M²-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills
VLA
world-model
manipulation
embodied-AI
Aug 20, 2026
Rethinking Token Reduction for Large Vision-Language Models
VLM
Aug 20, 2026
Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
VLA
manipulation
diffusion-policy
Aug 20, 2026
Do as I Do: Dexterous Manipulation Data from Everyday Human Videos
imitation-learning
manipulation
3D-representation
Aug 20, 2026
Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning
VLM
spatial-reasoning
Aug 20, 2026
Rethinking Intermediate Representation for VLM-based Robot Manipulation
manipulation
VLM
embodied-reasoning
Aug 20, 2026
HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution
LLM
task-planning
Aug 20, 2026
DataComp-VLM: Improved Open Datasets for Vision-Language Models
VLM
Aug 20, 2026
RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
computer-use
task-planning
VLM
Aug 20, 2026
KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis
embodied-reasoning
manipulation
VLM
Aug 20, 2026
DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
gui-agent
VLM
Aug 20, 2026
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
world-model
manipulation
VLA
Aug 20, 2026
Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
VLM
Aug 20, 2026
DENALI: A Dataset Enabling Non-Line-of-Sight Spatial Reasoning with Low-Cost LiDARs
spatial-reasoning
scene-understanding
3D-representation
Aug 20, 2026
Gemma 4 Technical Report
VLM
LLM
Aug 20, 2026
RehearseVLA: Simulated Post-Training for VLAs with Physically-Consistent World Model
VLA
world-model
agentic-RL
Aug 20, 2026
Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure
gui-agent
computer-use
VLM
Aug 20, 2026
HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
world-model
3D-representation
VLM
Aug 20, 2026
Curvature-Aware Captioning: Leveraging Geodesic Attention for 3D Scene Understanding
scene-understanding
spatial-reasoning
3D-representation
Aug 20, 2026
A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
agentic-RL
web-agent
Aug 20, 2026
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
VLM
spatial-reasoning
VLA
Aug 20, 2026
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
VLA
embodied-reasoning
task-planning
Aug 20, 2026
Recursive Agent Harnesses
LLM
task-planning
Aug 20, 2026
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
auto-research
agentic-RL
LLM
Aug 20, 2026
Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation
navigation
spatial-reasoning
scene-understanding
Aug 20, 2026
GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction
gui-agent
VLM
Aug 20, 2026
ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL
agentic-RL
task-planning
Aug 20, 2026
GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization (V1.0)
agentic-RL
task-planning
LLM
Aug 20, 2026
When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs
LLM
agentic-RL
Aug 20, 2026
FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
world-model
manipulation
VLA
Aug 20, 2026
ReFAct: Empowering Multimodal Web Agents with Visual and Context Focusing
web-agent
VLM
agentic-RL
Aug 20, 2026
Generative World Renderer
world-model
3D-representation
dataset
Aug 20, 2026
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning
VLM
agentic-RL
Aug 20, 2026
RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning
world-model
RL
Aug 20, 2026
Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models
VLA
task-planning
manipulation
Aug 20, 2026
Retrospective Harness Optimization: Improving LLM Agents via Self-Preference over Trajectory Rollouts
agentic-RL
Aug 20, 2026
FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification
VLM
agentic-RL
Aug 20, 2026
Generative World Renderer
world-model
3D-representation
Aug 20, 2026
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
video-LLM
video-understanding
VLM
Aug 20, 2026
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
VLM
scene-understanding
Aug 20, 2026
Gemini Robotics ER 1.6: Enhanced Embodied Reasoning
embodied-reasoning
spatial-reasoning
scene-understanding
Aug 20, 2026
CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
navigation
VLN
VLM
Aug 20, 2026
EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
gui-agent
VLM
Aug 20, 2026
RAAS: LLM Agentic System Architecture Search with GRPO
agentic-RL
LLM
Aug 20, 2026
GUIDE: Interpretable GUI Agent Evaluation via Hierarchical Diagnosis
GUI-Agent
Aug 20, 2026
EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents
computer-use
agentic-RL
gui-agent
Aug 20, 2026
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
agentic-RL
computer-use
gui-agent
Aug 20, 2026
Qwen-AgentWorld: Language World Models for General Agents
world-model
agentic-RL
computer-use
Aug 20, 2026
Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
VLA
world-model
manipulation
Aug 20, 2026
GEN-1: Scaling Embodied Foundation Models to Mastery
VLA
manipulation
imitation-learning
Aug 20, 2026
Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Models
VLM
Aug 20, 2026
CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning
gui-agent
agentic-RL
VLM
Aug 20, 2026
EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
VLA
manipulation
imitation-learning
Aug 20, 2026
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models
VLA
manipulation
Aug 20, 2026
Weak-to-Strong Generalization via Direct On-Policy Distillation
LLM
agentic-RL
Aug 20, 2026
BraveGuard: From Open-World Threats to Safer Computer-Use Agents
computer-use
gui-agent
Aug 20, 2026
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
VLM
Aug 20, 2026
DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation
manipulation
world-model
VLA
Aug 20, 2026
BiPreManip: Learning Affordance-Based Bimanual Preparatory Manipulation through Anticipatory Collaboration
manipulation
spatial-reasoning
imitation-learning
Aug 20, 2026
Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM
VLM
LLM
Aug 20, 2026
Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
VLA
cross-embodiment
Aug 20, 2026
QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
agentic-RL
LLM
Aug 20, 2026
AI Agents Do Not Fail Alone: The Context Fails First
LLM
instruction-following
Aug 20, 2026
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
video-LLM
video-understanding
VLM
Aug 20, 2026
Beyond Sequential Tools: A Unified VLM Agent System for Photographic Post-Processing via Dynamic Multi-Expert Fusion
VLM
task-planning
instruction-following
Aug 20, 2026
Heterogeneous Scientific Foundation Model Collaboration
LLM
agentic-RL
task-planning
Aug 20, 2026
Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation
LLM
instruction-following
Aug 20, 2026
PrivacyAlign: Contextual Privacy Alignment for LLM Agents
computer-use
agentic-RL
LLM
Aug 20, 2026
BAMI: Training-Free Bias Mitigation in GUI Grounding
gui-agent
computer-use
VLM
Aug 20, 2026
Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering
agentic-RL
task-planning
world-model
Aug 20, 2026
Beacon: Knowing When and How to Perform Agentic Visual Reasoning
VLM
agentic-RL
Aug 20, 2026
PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
LLM
instruction-following
Aug 20, 2026
AsyncWebRL: Efficient Multi-Step RL for Visual Web Agents
web-agent
agentic-RL
gui-agent
Aug 20, 2026
On Safety Risks in Experience-Driven Self-Evolving Agents
agentic-RL
gui-agent
web-agent
Aug 20, 2026
Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models
spatial-reasoning
VLM
agentic-RL
Aug 20, 2026
Emotion-Conditioned Short-Horizon Human Pose Forecasting with a Lightweight Predictive World Model
world-model
human-pose
prediction
multimodal
Aug 20, 2026
Benchmarking and Improving GUI Agents in High-Dynamic Environments
GUI-Agent
Benchmark
POMDP
Dynamic-Environment
VLM
Aug 20, 2026
Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators
spatial-reasoning
world-model
agentic-RL
VLM
Aug 20, 2026
BadWAM: When World-Action Models Dream Right but Act Wrong
world-model
manipulation
Aug 20, 2026
PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation
VLA
world-model
manipulation
Aug 20, 2026
Toward Generalist Autonomous Research via Hypothesis-Tree Refinement
auto-research
task-planning
LLM
Aug 20, 2026
Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
agentic-RL
VLM
spatial-reasoning
Aug 20, 2026
Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paper
auto-research
LLM
instruction-following
Aug 20, 2026
Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
VLA
imitation-learning
manipulation
Aug 20, 2026
Always-On Agents: A Survey of Persistent Memory, State, and Governance in LLM Agents
LLM
Aug 20, 2026
PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning
spatial-reasoning
VLM
RL
Aug 20, 2026
AlayaWorld: Long-Horizon and Playable Video World Generation
world-model
3D-representation
Aug 20, 2026
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
VLM
LLM
embodied-reasoning
Aug 20, 2026
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
LLM
task-planning
agentic-RL
Aug 20, 2026
Agents' Last Exam
computer-use
gui-agent
LLM
Aug 20, 2026
PV-Ground: Text-Guided Point-Voxel Interaction for 3D Visual Grounding
scene-understanding
3D-representation
spatial-reasoning
Aug 20, 2026
Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning
agentic-RL
web-agent
Aug 20, 2026
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
agentic-RL
LLM
Aug 20, 2026
PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
Agentic Video Summarization via Self-Reflecting Multimodal Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
Designing Agent-Ready Websites for AI Web Agents: A Framework for Machine Readability, Actionability, and Decision Reliability
web-agent
Aug 20, 2026
When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents
computer-use
LLM
agentic-RL
Aug 20, 2026
How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks
LLM
Aug 20, 2026
Agentic Retoucher for Text-To-Image Generation
VLM
task-planning
agentic-RL
Aug 20, 2026
Orca: The World is in Your Mind
world-model
VLM
VLA
Aug 20, 2026
AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation
agentic-RL
navigation
VLM
Aug 20, 2026
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
agentic-RL
web-agent
Aug 20, 2026
ABot-N1: Toward a General Visual Language Navigation Foundation Model
VLN
navigation
embodied-reasoning
Aug 20, 2026
Agentic Abstention: Do Agents Know When to Stop Instead of Act?
computer-use
web-agent
agentic-RL
Aug 20, 2026
DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
LLM
Aug 20, 2026
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
scene-understanding
3D-representation
semantic-map
Aug 20, 2026
ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
world-model
VLA
mobile-manipulation
Aug 20, 2026
OpenRath: Session-Centered Runtime State for Agent Systems
LLM
task-planning
Aug 20, 2026
From Agent Traces to Trust: A Survey of Evidence Tracing and Execution Provenance in LLM Agents
LLM
deep-research
Aug 20, 2026
ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
task-planning
spatial-memory
embodied-reasoning
Aug 20, 2026
Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining
VLA
imitation-learning
world-model
Aug 20, 2026
OctoT2I: A Self-Evolving Agentic Text-to-Image Router
task-planning
VLM
LLM
Aug 20, 2026
Are We Ready For An Agent-Native Memory System?
LLM
web-agent
Aug 20, 2026
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
VLA
agentic-RL
instruction-following
Aug 20, 2026
AgentDet: A Shared-Blackboard Multi-Agent Framework for Zero-/Few-Shot Object Detection
VLM
scene-understanding
LLM
Aug 20, 2026
OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
computer-use
gui-agent
task-planning
Aug 20, 2026
Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?
computer-use
gui-agent
Aug 20, 2026
Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes
computer-use
agentic-RL
Aug 20, 2026
Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection
VLM
LLM
Aug 20, 2026
OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models
gui-agent
computer-use
VLM
Aug 20, 2026
Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees
gui-agent
computer-use
task-planning
Aug 20, 2026
NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?
auto-research
LLM
Aug 20, 2026
AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding
VLA
manipulation
spatial-reasoning
Aug 20, 2026
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
µVLM: A Vision Language Model for µNPUs
VLM
Aug 20, 2026
Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
Naive Visual Memory is Not Enough: A Failure-Mode Study of GUI Agents
gui-agent
computer-use
Aug 20, 2026
iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception
gui-agent
computer-use
VLM
Aug 20, 2026
NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code
auto-research
3D-representation
LLM
Aug 20, 2026
Xiaomi-GUI-0 Technical Report
gui-agent
agentic-RL
Aug 20, 2026
AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence
manipulation
imitation-learning
spatial-reasoning
Aug 20, 2026
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
gui-agent
agentic-RL
computer-use
Aug 20, 2026
WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation
VLA
world-model
navigation
UAV
Aug 20, 2026
MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents
computer-use
gui-agent
web-agent
Aug 20, 2026
AdapAction: Adaptive Target Action Backdoor Attack against GUI Agents
gui-agent
computer-use
VLM
Aug 20, 2026
WebGym: Scaling Training Environments for Long-Horizon Visual Web Agents with Realistic Tasks
web-agent
gui-agent
agentic-RL
Aug 20, 2026
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
computer-use
agentic-RL
LLM
Aug 20, 2026
Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning
VLA
world-model
embodied-reasoning
task-planning
Aug 20, 2026
MonoVLM: Monocular 3D Visual Grounding with Vision Language Models
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces
computer-use
gui-agent
agentic-RL
Aug 20, 2026
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
VLM
video-LLM
video-understanding
Aug 20, 2026
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
VLA
manipulation
3D-representation
Aug 20, 2026
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
VLM
instruction-following
Aug 20, 2026
MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization
gui-agent
agentic-RL
computer-use
Aug 20, 2026
Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models
VLA
embodied-reasoning
VLM
Aug 20, 2026
Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents
computer-use
agentic-RL
LLM
Aug 20, 2026
WRIVINDER: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery
spatial-reasoning
3D-representation
navigation
Aug 20, 2026
MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis
world-model
LLM
VLM
Aug 20, 2026
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
VLA
world-model
embodied-reasoning
manipulation
Aug 20, 2026
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
VLA
manipulation
Aug 20, 2026
MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent
VLA
manipulation
cross-embodiment
Aug 20, 2026
WALL-WM: Carving World Action Modeling at the Event Joints
world-model
VLA
manipulation
embodied-reasoning
Aug 20, 2026
Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems
computer-use
web-agent
Aug 20, 2026
MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management
gui-agent
task-planning
LLM
Aug 20, 2026
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
VLA
world-model
action-generation
efficiency
Aug 20, 2026
VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?
VLM
spatial-reasoning
Aug 20, 2026
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
VLA
manipulation
embodied-reasoning
Aug 20, 2026
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
spatial-reasoning
scene-understanding
LLM
Aug 20, 2026
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
VLM
task-planning
agentic-RL
Aug 20, 2026
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
agentic-RL
VLM
Aug 20, 2026
MangoBench: A Benchmark for Multi-Agent Goal-Conditioned Offline Reinforcement Learning
RL
manipulation
navigation
Aug 20, 2026
AMusE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding
video-LLM
agentic-RL
video-understanding
Aug 20, 2026
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
VLM
spatial-reasoning
Aug 20, 2026
MVP: Multiple View Prediction Improves GUI Grounding
gui-agent
VLM
computer-use
Aug 20, 2026
BiCoord: A Bimanual Manipulation Benchmark towards Long-Horizon Spatial-Temporal Coordination
manipulation
VLA
diffusion-policy
Aug 20, 2026
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
video-LLM
video-understanding
VLM
Aug 20, 2026
Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation
VLA
world-model
manipulation
Aug 20, 2026
Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies
agentic-RL
LLM
Aug 20, 2026
VisPlay: Self-Evolving Vision-Language Models
agentic-RL
VLM
Aug 20, 2026
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
auto-research
LLM
web-agent
Aug 20, 2026
AGiLe: Learning Robust Long-Horizon Manipulation via Affordance-Grounded Bidirectional Latent Planning
manipulation
task-planning
spatial-reasoning
Aug 20, 2026
AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark
gui-agent
VLM
Aug 20, 2026
MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models
gui-agent
world-model
embodied-reasoning
Aug 20, 2026
Vinedresser3D: Towards Agentic Text-guided 3D Editing
3D-representation
VLM
task-planning
Aug 20, 2026
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
world-model
gui-agent
agentic-RL
Aug 20, 2026
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
VLA
embodied-reasoning
manipulation
Aug 20, 2026
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
agentic-RL
RL
LLM
Aug 20, 2026
Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation
manipulation
scene-understanding
spatial-reasoning
VLA
Aug 20, 2026
Multi-Agent Computer Use
computer-use
gui-agent
task-planning
Aug 20, 2026
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
video-LLM
agentic-RL
video-understanding
Aug 20, 2026
3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training
VLA
spatial-reasoning
manipulation
3D-representation
Aug 20, 2026
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
video-LLM
video-understanding
task-planning
Aug 20, 2026
Agentic Compilation: Mitigating the LLM Rerun Crisis for Minimized-Inference-Cost Web Automation
gui-agent
web-agent
task-planning
Aug 20, 2026
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
video-LLM
video-understanding
agentic-RL
Aug 20, 2026
Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
computer-use
gui-agent
LLM
task-planning
Aug 20, 2026
ViLoMem: Agentic Learner with Grow-and-Refine Multimodal Semantic Memory
VLM
LLM
Aug 20, 2026
WebTrap: Stealthy Mid-Task Hijacking of Browser Agents During Navigation
web-agent
Aug 20, 2026
Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
AgenticCache: Cache-Driven Asynchronous Planning for Embodied AI Agents
world-model
planning
embodied-AI
cache
Aug 20, 2026
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
VLM
task-planning
spatial-reasoning
Aug 20, 2026
Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence
agentic-RL
web-agent
world-model
Aug 20, 2026
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
scene-understanding
spatial-reasoning
VLN
Aug 20, 2026
Weasel: Out-of-Domain Generalization for Web Agents via Importance-Diversity Data Selection
web-agent
gui-agent
imitation-learning
Aug 20, 2026
VLM-PTQ: Efficient Post-Training Quantization for Large Vision-Language Models
VLM
Aug 20, 2026
Escaping the Context Bottleneck: Active Context Curation for LLM Agents via Reinforcement Learning
gui-agent
web-agent
agentic-RL
Aug 20, 2026
When Vision Speaks for Sound
VLM
video-LLM
agentic-RL
Aug 20, 2026
LensWalk: Agentic Video Understanding by Planning How You See in Videos
video-LLM
video-understanding
task-planning
Aug 20, 2026
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
spatial-reasoning
VLM
Aug 20, 2026
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
video-LLM
agentic-RL
VLM
Aug 20, 2026
Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning
RL
manipulation
Aug 20, 2026
Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration
web-agent
gui-agent
VLM
Aug 20, 2026
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
gui-agent
VLM
imitation-learning
Aug 20, 2026
VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery
VLM
3D-representation
embodied-reasoning
Aug 20, 2026
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
video-LLM
VLM
Aug 20, 2026
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
spatial-reasoning
VLM
video-understanding
Aug 20, 2026
TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation
LLM
spatial-reasoning
Aug 20, 2026
VLM4RSDet: Collaborative Optimization with Vision-Language Model for Enhancing Remote Sensing Object Detection
VLM
scene-understanding
Aug 20, 2026
Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
computer-use
gui-agent
agentic-RL
Aug 20, 2026
TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs
VLM
LLM
Aug 20, 2026
A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model
VLA
flow-matching
manipulation
Aug 20, 2026
Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images
3D-representation
spatial-reasoning
embodied-reasoning
Aug 20, 2026
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
VLM
3D-representation
spatial-reasoning
Aug 20, 2026
LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
agentic-RL
task-planning
LLM
Aug 20, 2026
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
agentic-RL
VLM
Aug 20, 2026
WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces
web-agent
gui-agent
agentic-RL
Aug 20, 2026
VIRAL: Visual Sim-to-Real at Scale for Humanoid Loco-Manipulation
mobile-manipulation
legged
manipulation
Aug 20, 2026
Video-Oasis: Rethinking Evaluation of Video Understanding
video-understanding
video-LLM
Aug 20, 2026
LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents
computer-use
gui-agent
web-agent
Aug 20, 2026
SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation
GUI-Agent
Aug 20, 2026
SecAgent: Efficient Mobile GUI Agent with Semantic Context
web-agent
Aug 20, 2026
SecAgent: Efficient Mobile GUI Agent with Semantic Context
gui-agent
computer-use
VLM
Aug 20, 2026
Unsupervised Multi-agent and Single-agent Perception from Cooperative Views
scene-understanding
3D-representation
Aug 20, 2026
LARA: Latent Action Representation Alignment for Vision-Language-Action Models
VLA
imitation-learning
world-model
flow-matching
Aug 20, 2026
TeamBench: Evaluating Agent Coordination under Enforced Role Separation
task-planning
LLM
hci
Aug 20, 2026
Unlimited OCR Works
VLM
LLM
Aug 20, 2026
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
gui-agent
VLM
Aug 20, 2026
Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
web-agent
gui-agent
Aug 20, 2026
T^2PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning
agentic-RL
gui-agent
Aug 20, 2026
Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent
VLM
LLM
instruction-following
Aug 20, 2026
StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction
agentic-RL
task-planning
Aug 20, 2026
Jailbreaking Vision-Language Models via Dissonance-Guided Suffix Optimization and Image-Phrase Injection
VLM
Aug 20, 2026
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
VLA
mobile-manipulation
imitation-learning
Aug 20, 2026
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
VLM
scene-understanding
embodied-reasoning
Aug 20, 2026
UZ3DVG: Unaided Zero-Shot 3D Visual Grounding with Generated Language Conditions
spatial-reasoning
scene-understanding
VLM
Aug 20, 2026
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
spatial-reasoning
VLM
navigation
Aug 20, 2026
Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
agentic-RL
VLA
task-planning
Aug 20, 2026
SkillOpt: Executive Strategy for Self-Evolving Agent Skills
agentic-RL
task-planning
LLM
Aug 20, 2026
SEVerA: Verified Synthesis of Self-Evolving Agents
agentic-RL
task-planning
Aug 20, 2026
Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
gui-agent
agentic-RL
task-planning
Aug 20, 2026
InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
diffusion-policy
instruction-following
world-model
Aug 20, 2026
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
agentic-RL
task-planning
Aug 20, 2026
InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
spatial-reasoning
VLM
scene-understanding
OB
CN
OB/CN
Aug 20, 2026
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
gui-agent
VLM
Aug 20, 2026
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
VLM
world-model
Aug 20, 2026
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
VLA
manipulation
task-planning
Aug 20, 2026
Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds
scene-understanding
3D-representation
spatial-reasoning
Aug 20, 2026
IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding
VLM
gui-agent
Aug 20, 2026
SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?
computer-use
web-agent
gui-agent
Aug 20, 2026
TopoMA: Topology-Guided Multi-Agent Dense RGB 3D Reconstruction via Distributed Inference
3D-representation
SLAM
spatial-memory
Aug 20, 2026
HybridDriveVLA: Vision-Language-Action Model with Visual CoT reasoning and ToT Evaluation for Autonomous Driving
VLA
embodied-reasoning
world-model
Aug 20, 2026
From Where Things Are to What They Are For: Benchmarking Spatial–Functional Intelligence in Multimodal LLMs
spatial-reasoning
VLM
video-understanding
Aug 20, 2026
PersonaVLM: Long-Term Personalized Multimodal LLMs
VLM
agentic-RL
LLM
Aug 20, 2026
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search
video-LLM
video-understanding
VLM
Aug 20, 2026
PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent
GUI-Agent
Aug 20, 2026
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
SEAL: Synergistic Co-Evolution of Agents and Learning Environments
agentic-RL
LLM
Aug 20, 2026
HiconAgent: History Context-aware Policy Optimization for GUI Agents
gui-agent
agentic-RL
VLM
Aug 20, 2026
Think, Then Verify: A Hypothesis–Verification Multi-Agent Framework for Long Video Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies
VLA
manipulation
imitation-learning
Aug 20, 2026
Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime
agentic-RL
RL
Aug 20, 2026
A History-Aware Visually Grounded Critic for Computer Use Agents
gui-agent
computer-use
VLM
Aug 20, 2026
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic–Spatial Fusion and Latent Predictive Representation
VLN
VLA
world-model
spatial-reasoning
Ep
Aug 20, 2026
TaskForce: Cooperative Multi-agent Reinforcement Learning for Multi-task Optimization
RL
Aug 20, 2026
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Tackling Model Bias via Game-theoretic Multi-agent Collaboration Framework for Hateful Meme Classification
VLM
LLM
Aug 20, 2026
PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents
gui-agent
computer-use
instruction-following
Aug 20, 2026
TRM-VLA: Temporal-Aware Chain-of-Thought Reasoning and Memorization for Vision-Language-Action Models
VLA
embodied-reasoning
manipulation
Aug 20, 2026
TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
agentic-RL
Aug 20, 2026
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
VLA
world-model
manipulation
Aug 20, 2026
Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation
VLN
spatial-memory
world-model
Aug 20, 2026
SyncMos: Scalable Motion Synchronisation for Multi-Agent Scene Interaction
embodied-reasoning
task-planning
scene-understanding
Aug 20, 2026
Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding
video-LLM
video-understanding
task-planning
Aug 20, 2026
Region4Web: Rethinking Observation Space Granularity for Web Agents
web-agent
gui-agent
Aug 20, 2026
Hear you are: Teaching LLMs Spatial Reasoning with Vision and Spatial Sound
spatial-reasoning
VLM
scene-understanding
Aug 20, 2026
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
gui-agent
VLM
computer-use
Aug 20, 2026
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
VLA
manipulation
Aug 20, 2026
SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks
spatial-reasoning
gui-agent
VLM
Aug 20, 2026
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Hybrid Self-evolving Structured Memory for GUI Agents
VLM
task-planning
web-agent
Aug 20, 2026
Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps
LLM
Aug 20, 2026
Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops
agentic-RL
LLM
Aug 20, 2026
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
HybridMemory: Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models
world-model
spatial-memory
Aug 20, 2026
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
gui-agent
computer-use
VLM
Aug 20, 2026
SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Web Agents Should Adopt the Plan-Then-Execute Paradigm
web-agent
gui-agent
task-planning
Aug 20, 2026
Grounded 3D-Aware Spatial Vision-Language Modeling
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence
3D-representation
scene-understanding
spatial-reasoning
Aug 20, 2026
SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL
spatial-reasoning
agentic-RL
embodied-reasoning
Aug 20, 2026
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
VLA
imitation-learning
manipulation
Aug 20, 2026
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
VLM
LLM
Aug 20, 2026
π-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
gui-agent
task-planning
LLM
Aug 20, 2026
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
VLM
agentic-RL
Aug 20, 2026
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
VLA
manipulation
Aug 20, 2026
Socratic-Geo: Synthetic Data Generation and Cross-Modal Geometric Reasoning via Multi-Agent Interaction
VLM
spatial-reasoning
agentic-RL
Aug 20, 2026
PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control
gui-agent
agentic-RL
Aug 20, 2026
SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Geometrically-Constrained Agent for Spatial Reasoning
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
EvoScientist: Towards Multi-Agent Evolving AI Scientists for End-to-End Scientific Discovery
auto-research
LLM
Aug 20, 2026
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
web-agent
agentic-RL
VLM
Aug 20, 2026
SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows
web-agent
task-planning
Aug 20, 2026
GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
VLA
manipulation
3D-representation
Aug 20, 2026
OpenComputer: Verifiable Software Worlds for Computer-Use Agents
computer-use
gui-agent
Aug 20, 2026
Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents
gui-agent
web-agent
task-planning
Aug 20, 2026
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
DyGeoVLN: Infusing Dynamic Geometry Foundation Model into Vision-Language Navigation
VLN
3D-representation
spatial-reasoning
Aug 20, 2026
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
gui-agent
video-LLM
VLM
Aug 20, 2026
ShowUI-π: Flow-based Generative Models as GUI Dexterous Hands
gui-agent
computer-use
flow-matching
Aug 20, 2026
GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models
VLA
manipulation
spatial-reasoning
Aug 20, 2026
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
LLM
Aug 20, 2026
SenseSearch: Empowering Vision-Language Models with High-Resolution Agentic Search-Reasoning via Reinforcement Learning
VLM
agentic-RL
web-agent
Aug 20, 2026
Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis
VLM
Aug 20, 2026
OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
world-model
manipulation
VLA
Aug 20, 2026
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
VLA
manipulation
diffusion-policy
Aug 20, 2026
GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents
computer-use
gui-agent
task-planning
Aug 20, 2026
MolmoAct2: Action Reasoning Models for Real-world Deployment
VLA
embodied-reasoning
manipulation
Aug 20, 2026
CAPTCHA Solving for Native GUI Agents: Automated Reasoning-Action Data Generation and Self-Corrective Training
GUI-Agent
Aug 20, 2026
GUI-SAGE: Enhancing GUI Automation with Self-Explanatory Learning
gui-agent
agentic-RL
VLM
Aug 20, 2026
How Mobile World Model Guides GUI Agents?
gui-agent
world-model
VLM
Aug 20, 2026
The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes
web-agent
Aug 20, 2026
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
gui-agent
computer-use
VLM
Aug 20, 2026
MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research
gui-agent
agentic-RL
Aug 20, 2026
GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots
gui-agent
agentic-RL
Aug 20, 2026
Evolve as a Team: Collaborative Self-Evolution for LLM-based Multi-Agent Systems
multi-agent
LLM
self-evolving-agents
Aug 20, 2026
Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
gui-agent
web-agent
agentic-RL
Aug 20, 2026
Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents
LLM
web-agent
agentic-RL
Aug 20, 2026
GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training
agentic-RL
VLM
embodied-reasoning
Aug 20, 2026
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
gui-agent
agentic-RL
VLM
Aug 20, 2026
GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors
imitation-learning
manipulation
VLA
3D-representation
Aug 20, 2026
AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents
gui-agent
task-planning
Aug 20, 2026
Mem-W: Latent Memory-Native GUI Agents
gui-agent
web-agent
agentic-RL
Aug 20, 2026
G2 VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
spatial-reasoning
3D-representation
VLM
Aug 20, 2026
AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents
computer-use
web-agent
task-planning
Aug 20, 2026
Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
Aug 20, 2026
From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
VLA
manipulation
embodied-reasoning
Aug 20, 2026
Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism
deep-research
LLM
Aug 20, 2026
From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agents
deep-research
LLM
Aug 20, 2026
MMSkills: Towards Multimodal Skills for General Visual Agents
gui-agent
task-planning
VLM
Aug 20, 2026
First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models
VLM
scene-understanding
Aug 20, 2026
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
VLM
video-understanding
Aug 20, 2026
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
world-model
video-LLM
Aug 20, 2026
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients
VLM
LLM
Aug 20, 2026
ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments
VLA
cross-embodiment
spatial-reasoning
Aug 20, 2026
Revisiting Observation Reduction for Web Agents: Comprehensive Evaluation with a Lightweight Framework
web-agent
gui-agent
Aug 20, 2026
FastContext: Training Efficient Repository Explorer for Coding Agents
LLM
task-planning
auto-research
Aug 20, 2026
TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning
web-agent
reinforcement-learning
preference-optimization
credit-assignment
Aug 20, 2026
LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
world-model
VLM
Aug 20, 2026
ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data
computer-use
gui-agent
VLM
Aug 20, 2026
Evaluating and Easing Hallucinations for GUI Grounding
gui-agent
VLM
computer-use
Aug 20, 2026
LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
gui-agent
agentic-RL
computer-use
Aug 20, 2026
Exploring Spatial Intelligence from a Generative Perspective
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Robix: A Unified Model for Robot Interaction, Reasoning and Planning
embodied-reasoning
task-planning
VLM
Aug 20, 2026
IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools
VLM
agentic-RL
Aug 20, 2026
Experience Transfer for Multimodal LLM Agents in Minecraft Game
embodied-reasoning
task-planning
VLM
Aug 20, 2026
Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution
VLA
manipulation
flow-matching
Aug 20, 2026
Harnessing LLM Agents with Skill Programs
agentic-RL
LLM
task-planning
Aug 20, 2026
Pure Vision-Language-Action (VLA) Models: A Comprehensive Survey
VLA
manipulation
embodied-reasoning
Aug 20, 2026
EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval
agentic-RL
VLM
web-agent
Aug 20, 2026
Recovering Policy-Induced Errors: Benchmarking and Trajectory Synthesis for Robust GUI Agents
gui-agent
agentic-RL
Aug 20, 2026
GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents
agentic-RL
task-planning
Aug 20, 2026
Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application
agentic-RL
LLM
world-model
Aug 20, 2026
OmniEVA: Embodied Versatile PlAnner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning
embodied-reasoning
spatial-reasoning
task-planning
Aug 20, 2026
What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity
VLM
agentic-RL
gui-agent
Aug 20, 2026
OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds
GUI-Agent
Aug 20, 2026
Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching
spatial-reasoning
VLM
Aug 20, 2026
When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents
computer-use
LLM
Aug 20, 2026
NavFoM: Embodied Navigation Foundation Model
VLN
navigation
cross-embodiment
VLM
Aug 20, 2026
World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy
world-model
VLA
agentic-RL
Aug 20, 2026
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
web-agent
video-understanding
VLM
Aug 20, 2026
EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL
agentic-RL
LLM
Aug 20, 2026
Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents
agentic-RL
LLM
computer-use
Aug 20, 2026
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
agentic-RL
LLM
Aug 20, 2026
WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning
agentic-RL
web-agent
Aug 20, 2026
Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Don't Click That: Teaching Web Agents to Resist Deceptive Interfaces
web-agent
gui-agent
agentic-RL
Aug 20, 2026
World-Model-Augmented Web Agents with Action Correction
web-agent
world-model
task-planning
Aug 20, 2026
Agentic Reward Modeling: Verifying GUI Agent via Online Proactive Interaction
agentic-RL
gui-agent
computer-use
Aug 20, 2026
Rethinking Cross-Layer Information Routing in Diffusion Transformers
VLM
world-model
Aug 20, 2026
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
embodied-reasoning
VLM
spatial-reasoning
Aug 20, 2026
ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents
gui-agent
computer-use
agentic-RL
Aug 20, 2026
CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing
gui-agent
computer-use
Aug 20, 2026
UniPlan: Vision-Language Task Planning for Mobile Manipulation with Unified PDDL Formulation
task-planning
mobile-manipulation
embodied-reasoning
Aug 20, 2026
EG-3DVG: Expression and Geometry Aware Grounding Decoder for 3D Visual Grounding
scene-understanding
spatial-reasoning
VLM
Aug 20, 2026
Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
LLM
gui-agent
VLM
Aug 20, 2026
When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training
agentic-RL
LLM
Aug 20, 2026
ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents
gui-agent
computer-use
VLM
Aug 20, 2026
Task Decomposition as Reliability Engineering in GUI Agents
web-agent
Aug 20, 2026
ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation
VLA
3D-representation
spatial-reasoning
manipulation
Aug 20, 2026
See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch
GUI-Agent
Aug 20, 2026
Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
agentic-RL
computer-use
gui-agent
Aug 20, 2026
Code as Agent Harness: Toward Executable, Verifiable, and Stateful Agent Systems
LLM
gui-agent
computer-use
task-planning
Aug 20, 2026
RynnBrain: Open Embodied Foundation Models
VLA
spatial-reasoning
task-planning
Aug 20, 2026
Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
gui-agent
computer-use
Aug 20, 2026
AnywhereVLA: Language-Conditioned Exploration and Mobile Manipulation
mobile-manipulation
VLA
SLAM
Aug 20, 2026
CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
gui-agent
agentic-RL
LLM
Aug 20, 2026
RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation
VLA
manipulation
embodied-reasoning
Aug 20, 2026
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
agentic-RL
web-agent
Aug 20, 2026
WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent
web-agent
deep-research
multimodal
vision-language
information-seeking
Aug 20, 2026
TinyClick: Single-Turn Agent for Empowering GUI Automation
Aug 20, 2026
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
agentic-RL
gui-agent
Aug 20, 2026
Process Rewards with Learned Reliability
agentic-RL
VLM
Aug 20, 2026
Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents
GUI-Agent
Aug 20, 2026
Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark
agentic-RL
LLM
task-planning
Self-Motivat
Aug 20, 2026
MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents
agentic-RL
LLM
task-planning
Steps
Aug 20, 2026
A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems
agentic-RL
LLM
task-planning
Aug 20, 2026
Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment
gui-agent
computer-use
VLM
Aug 20, 2026
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
gui-agent
task-planning
Aug 20, 2026
OpenCUA: Open Foundations for Computer-Use Agents
computer-use
gui-agent
VLM
imitation-learning
Aug 20, 2026
AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild
gui-agent
instruction-following
Aug 20, 2026
Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents
computer-use
gui-agent
Aug 20, 2026
AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration
auto-research
agentic-RL
Aug 20, 2026
ActionEngine: From Reactive to Programmatic GUI Agents via State Machine Memory
gui-agent
web-agent
task-planning
Aug 20, 2026
Kimi K2.5: Visual Agentic Intelligence
VLM
agentic-RL
LLM
Aug 20, 2026
ANCHOR: Branch-Point Data Generation for GUI Agents
gui-agent
computer-use
Aug 20, 2026
OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use
computer-use
gui-agent
web-agent
Aug 20, 2026
AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding
gui-agent
VLM
computer-use
Aug 20, 2026
Adaptive Milestone Reward for GUI Agents
agentic-RL
gui-agent
RL
Aug 20, 2026
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
LLM
Aug 20, 2026
Autonomous Continual Learning for Environment Adaptation of Computer-Use Agents
computer-use
agentic-RL
gui-agent
Aug 20, 2026
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
agentic-RL
LLM
Aug 20, 2026
GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning
VLA
world-model
manipulation
Aug 20, 2026
ZonUI-3B: Competitive GUI Grounding with a 3B VLM Trained on a Single Consumer GPU
gui-agent
VLM
computer-use
Aug 20, 2026
AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications
gui-agent
Aug 20, 2026
WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks
web-agent
agentic-RL
gui-agent
Aug 20, 2026
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
embodied-reasoning
VLA
agentic-RL
manipulation
spatial-reasoning
Aug 20, 2026
AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use
computer-use
agentic-RL
Aug 20, 2026
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
gui-agent
agentic-RL
Aug 20, 2026
VLMDiff: Leveraging Vision-Language Models for Multi-Class Anomaly Detection with Diffusion
VLM
scene-understanding
Aug 20, 2026
Active Learners as Efficient PRP Rerankers
LLM
agentic-RL
Aug 20, 2026
One Agent to Guide Them All: Empowering MLLMs for Vision-and-Language Navigation via Explicit World Representation
VLN
navigation
embodied-reasoning
Aug 20, 2026
ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration
auto-research
LLM
task-planning
Aug 20, 2026
Thinker: A vision-language foundation model for embodied intelligence
VLM
embodied-reasoning
task-planning
Aug 20, 2026
ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents
computer-use
agentic-RL
gui-agent
Params
Aug 20, 2026
AI for Auto-Research: Roadmap & User Guide
auto-research
LLM
Aug 20, 2026
SwipeGen: Bridging the Execution Gap in GUI Agents via Human-like Swipe Synthesis
GUI-Agent
Aug 20, 2026
CoAct-1: Computer-using Multi-agent System with Coding Actions
computer-use
gui-agent
task-planning
Aug 20, 2026
World Action Models are Zero-shot Policies
world-model
VLA
manipulation
cross-embodiment
Aug 20, 2026
A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains
web-agent
gui-agent
Aug 20, 2026
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
VLN
spatial-memory
scene-understanding
Img
Aug 20, 2026
Agent Lightning: Train ANY AI Agents with Reinforcement Learning
agentic-RL
LLM
Aug 20, 2026
Safe Vision-Language Models via Unsafe Weights Manipulation
VLM
Aug 20, 2026
WebSynthesis: World-Model-Guided MCTS for Efficient WebUI-Trajectory Synthesis
web-agent
world-model
task-planning
Aug 20, 2026
DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI
VLA
manipulation
navigation
mobile-manipulation
1/2/3
Aug 20, 2026
WebSailor: Navigating Super-human Reasoning for Web Agent
web-agent
deep-research
information-seeking
reinforcement-learning
reasoning
Aug 20, 2026
RoboBrain 2.5: Depth in Sight, Time in Mind
spatial-reasoning
VLA
RL
Aug 20, 2026
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
VLN
cross-embodiment
navigation
Aug 20, 2026
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
gui-agent
instruction-following
hci
Aug 20, 2026
OpenLVLM-MIA: A Controlled Benchmark Revealing the Limits of Membership Inference Attacks on Large Vision-Language Models
VLM
Aug 20, 2026
Agentic Test-Time Scaling for WebAgents
web-agent
gui-agent
LLM
Aug 20, 2026
OmegaUse: Building a General-Purpose GUI Agent for Autonomous Task Execution
gui-agent
computer-use
agentic-RL
Aug 20, 2026
RT-H: Action Hierarchies Using Language
VLA
imitation-learning
instruction-following
Aug 20, 2026
OS-Marathon: Benchmarking Computer-Use Agents on Long-Horizon Repetitive Tasks
computer-use
gui-agent
task-planning
Aug 20, 2026
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Empirical Evidence on Conversational Control of GUI in Semantic Automation
manipulation
scene-understanding
Aug 20, 2026
MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
agentic-RL
LLM
Aug 20, 2026
BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation
mobile-manipulation
task-planning
Aug 20, 2026
MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution
gui-agent
task-planning
Aug 20, 2026
AgentStudio: A Toolkit for Building General Virtual Agents
GUI-Agent
Aug 20, 2026
Learning with Challenges: Adaptive Difficulty-Aware Data Generation for Mobile GUI Agent Training
GUI-Agent
Aug 20, 2026
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
VLN
video-LLM
VLA
navigation
Aug 20, 2026
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence
agentic-RL
LLM
task-planning
Aug 20, 2026
GUIGuard-Bench: Toward a General Evaluation for Privacy-Preserving GUI Agents
gui-agent
computer-use
VLM
Aug 20, 2026
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
GUI-Agent
Aug 20, 2026
FairVLM: Enhancing Fairness and Prompt Sensitivity in Vision Language Models for Medical Image Segmentation
VLM
Aug 20, 2026
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
VLN
VLM
navigation
Aug 20, 2026
RoboBrain 2.0 Technical Report
spatial-reasoning
VLM
task-planning
Samples
Tunable
Aug 20, 2026
EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience
computer-use
agentic-RL
gui-agent
Aug 20, 2026
UIPro: Unleashing Superior Interaction Capability For GUI Agents
VLM
imitation-learning
scene-understanding
Aug 20, 2026
Genie: Generative Interactive Environments
world-model
video-LLM
Params
Aug 20, 2026
UI-Venus Technical Report: Building High-performance UI Agents with RFT
VLM
navigation
RL
Aug 20, 2026
Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation
navigation
scene-understanding
spatial-memory
Aug 20, 2026
CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding
VLA
manipulation
embodied-reasoning
LLM-subtasks
gripper-state-segments
Aug 20, 2026
UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning
imitation-learning
RL
scene-understanding
Aug 20, 2026
WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
web-agent
benchmark
multimodal
live-web
evaluation
Aug 20, 2026
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
GUI-Agent
Aug 20, 2026
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
web-agent
benchmark
multimodal
visual-grounding
evaluation
Aug 20, 2026
UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
navigation
imitation-learning
RL
Aug 20, 2026
macOSWorld: A Multilingual Interactive Benchmark for GUI Agents
GUI-Agent
Aug 20, 2026
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
GUI-Agent
Aug 20, 2026
Towards Trustworthy GUI Agents: A Survey
web-agent
Aug 20, 2026
Compress to Focus: Efficient Coordinate Compression for Policy Optimization in Multi-Turn GUI Agents
gui-agent
agentic-RL
Aug 20, 2026
Toward a Human-Centered Evaluation Framework for Trustworthy LLM-Powered GUI Agents
web-agent
Aug 20, 2026
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
VLM
scene-understanding
Aug 20, 2026
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
VLM
navigation
scene-understanding
Aug 20, 2026
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
VLM
Aug 20, 2026
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
VLM
imitation-learning
RL
Aug 20, 2026
GPT-4V(ision) is a Generalist Web Agent, if Grounded
gui-agent
web-agent
VLM
Aug 20, 2026
Visual Agentic AI for Spatial Reasoning with a Dynamic API
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
A Survey of Reinforcement Learning for Optimization in Automation
RL
cross-embodiment
Aug 20, 2026
A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning
VLA
RL
web-agent
Aug 20, 2026
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
SpiritSight Agent: Advanced GUI Agent with One Look
VLM
navigation
imitation-learning
Aug 20, 2026
ScaleTrack: Scaling and back-tracking Automated GUI Agents
imitation-learning
scene-understanding
web-agent
Aug 20, 2026
OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics
mobile-manipulation
scene-understanding
manipulation
1-2
Aug 20, 2026
AirNav: A Large-Scale Real-World UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions
VLN
agentic-RL
navigation
Aug 20, 2026
Retrieval-augmented GUI Agents with Generative Guidelines
VLM
imitation-learning
web-agent
Aug 20, 2026
ProBench: Benchmarking GUI Agents with Accurate Process Information
imitation-learning
web-agent
Aug 20, 2026
A Plan Reuse Mechanism for LLM-Driven Agent
imitation-learning
Aug 20, 2026
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
VLA
spatial-reasoning
embodied-reasoning
Aug 20, 2026
PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents
navigation
imitation-learning
task-planning
Aug 20, 2026
AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent
gui-agent
VLM
computer-use
Aug 20, 2026
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
imitation-learning
RL
scene-understanding
Aug 20, 2026
OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds
Aug 20, 2026
WebHarbor: Docking Real Websites for Evolving GUI Agent Environments
web-agent
gui-agent
computer-use
Aug 20, 2026
Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation
mobile-manipulation
imitation-learning
manipulation
Aug 20, 2026
The Obvious Invisible Threat: LLM-Powered GUI Agents' Vulnerability to Fine-Print Injections
web-agent
Aug 20, 2026
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
VLM
navigation
imitation-learning
Aug 20, 2026
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
navigation
imitation-learning
scene-understanding
Aug 20, 2026
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
VLM
imitation-learning
web-agent
Aug 20, 2026
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
VLM
task-planning
instruction-following
Aug 20, 2026
MobileUse: A GUI Agent with Hierarchical Reflection for Autonomous Mobile Operation
navigation
imitation-learning
scene-understanding
Aug 20, 2026
UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience
RL
task-planning
web-agent
Aug 20, 2026
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
VLM
scene-understanding
spatial-reasoning
Aug 20, 2026
UI Remix: Supporting UI Design Through Interactive Example Retrieval and Remixing
navigation
Aug 20, 2026
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
navigation
RL
web-agent
Aug 20, 2026
You Only Look at Screens: Multimodal Chain-of-Action Agents
GUI-Agent
Aug 20, 2026
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
GUI-Agent
Aug 20, 2026
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
VLM
imitation-learning
task-planning
Aug 20, 2026
Mobile-Agent-v3: Fundamental Agents for GUI Automation
RL
scene-understanding
web-agent
Aug 20, 2026
Too Helpful to Be Safe: User-Mediated Attacks on Planning and Web-Use Agents
Aug 20, 2026
WebCanvas: Benchmarking Web Agents in Online Environments
imitation-learning
RL
scene-understanding
Aug 20, 2026
MEGA-GUI: Multi-stage Enhanced Grounding Agents for GUI Elements
VLM
scene-understanding
Aug 20, 2026
Synergy: A Next-Generation General-Purpose Agent for Open Agentic Web
RL
scene-understanding
Aug 20, 2026
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
VLM
scene-understanding
3D-representation
Aug 20, 2026
ShowUI-Aloha: Human-Taught GUI Agent
GUI-Agent
Aug 20, 2026
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
VLN
agentic-RL
video-LLM
Aug 20, 2026
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
VLM
imitation-learning
RL
Aug 20, 2026
MobileDreamer: Generative Sketch World Model for GUI Agent
world-model
task-planning
web-agent
Aug 20, 2026
M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
imitation-learning
web-agent
Aug 20, 2026
Towards Visual Grounding: A Survey
scene-understanding
Aug 20, 2026
MAESTRO: Adapting GUIs and Guiding Navigation with User Preferences in Conversational Agents with GUIs
navigation
Aug 20, 2026
LLM-Powered GUI Agents in Phone Automation: Surveying Progress and Prospects
VLM
imitation-learning
RL
Aug 20, 2026
LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code
imitation-learning
Aug 20, 2026
LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation
VLA
navigation
imitation-learning
Aug 20, 2026
Semantic Web Technology for Agent Communication Protocols
Aug 20, 2026
Less is More: Empowering GUI Agent with Context-Aware Simplification
navigation
imitation-learning
web-agent
Aug 20, 2026
LearnAct: Few-Shot Mobile GUI Agent with a Unified Demonstration Benchmark
imitation-learning
web-agent
Aug 20, 2026
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
imitation-learning
RL
web-agent
Aug 20, 2026
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
VLM
imitation-learning
scene-understanding
Aug 20, 2026
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
world-model
video-understanding
manipulation
Samples
Aug 20, 2026
LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents
imitation-learning
scene-understanding
web-agent
Aug 20, 2026
How Smart Is Your GUI Agent? A Framework for the Future of Software Interaction
web-agent
Aug 20, 2026
Riemannian Optimization for Deep Learning
manifold
optimization
riemannian
deep-learning
Aug 20, 2026
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
VLM
imitation-learning
RL
Aug 20, 2026
Intelligent Interaction Strategies for Context-Aware Cognitive Augmentation
imitation-learning
Aug 20, 2026
Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
imitation-learning
scene-understanding
web-agent
Aug 20, 2026
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
scene-understanding
task-planning
web-agent
Aug 20, 2026
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
VLM
scene-understanding
web-agent
Aug 20, 2026
History-Aware Reasoning for GUI Agents
imitation-learning
RL
task-planning
Aug 20, 2026
GUISpector: An MLLM Agent Framework for Automated Verification of Natural Language Requirements in GUI Prototypes
imitation-learning
Aug 20, 2026
The Multimodal Universe: Enabling Large-Scale Machine Learning with 100TB of Astronomical Scientific Data
Aug 20, 2026
From Model-Based Screening to Data-Driven Surrogates: A Multi-Stage Workflow for Exploring Stochastic Agent-Based Models
navigation
Aug 20, 2026
UITron-Speech: Towards Automated GUI Agents Based on Speech Instructions
GUI-Agent
Aug 20, 2026
GUIrilla: A Scalable Framework for Automated Desktop UI Exploration
VLM
navigation
scene-understanding
Aug 20, 2026
MobileFlow: A Multimodal LLM For Mobile GUI Agent
VLM
VLA
scene-understanding
Aug 20, 2026
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
navigation
imitation-learning
task-planning
Aug 20, 2026
Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic Manipulation
manipulation
diffusion-policy
imitation-learning
Aug 20, 2026
Continual GUI Agents
RL
scene-understanding
web-agent
Aug 20, 2026
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies
imitation-learning
web-agent
Aug 20, 2026
A mechanism for discovering semantic relationships among agent communication protocols
Aug 20, 2026
GUI-ReWalk: Massive Data Generation for GUI Agent via Stochastic Exploration and Intent-Aware Reasoning
navigation
imitation-learning
task-planning
Aug 20, 2026
Competing Visions of Ethical AI: A Case Study of OpenAI
Aug 20, 2026
BEAP-Agent: Backtrackable Execution and Adaptive Planning for GUI Agents
navigation
task-planning
web-agent
Aug 20, 2026
GUI-PRA: Process Reward Agent for GUI Tasks
RL
task-planning
Aug 20, 2026
Large Language Model-Brained GUI Agents: A Survey
VLM
navigation
imitation-learning
Aug 20, 2026
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
VLM
imitation-learning
task-planning
Aug 20, 2026
AI prediction leads people to forgo guaranteed rewards
RL
Aug 20, 2026
Adaptive Milestone Reward for GUI Agents
GUI-Agent
Aug 20, 2026
Improved GUI Grounding via Iterative Narrowing
VLM
imitation-learning
RL
Aug 20, 2026
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
navigation
scene-understanding
web-agent
Aug 20, 2026
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
VLA
flow-matching
manipulation
Aug 20, 2026
GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
VLM
navigation
imitation-learning
Aug 20, 2026
Hyperbolic Neural Networks: A Survey
hyperbolic
manifold
survey
neural-network
Aug 20, 2026
Hyperbolic Graph Neural Networks
hyperbolic
GNN
manifold
graph
Aug 20, 2026
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
navigation
imitation-learning
web-agent
Aug 20, 2026
WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control
VLA
mobile-manipulation
legged
Aug 20, 2026
GUICourse: From General Vision Language Models to Versatile GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
imitation-learning
web-agent
Aug 20, 2026
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
Aug 20, 2026
WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment
web-agent
task-planning
Aug 20, 2026
Foundations of GenIR
VLM
imitation-learning
scene-understanding
Aug 20, 2026
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
imitation-learning
scene-understanding
web-agent
Aug 20, 2026
Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents
gui-agent
computer-use
video-understanding
Aug 20, 2026
Ferret-UI Lite: Lessons from Building Small On-Device GUI Agents
navigation
RL
scene-understanding
Aug 20, 2026
Global refined Fujita-Kato solution of 3-D inhomogeneous incompressible Navier-Stokes equations with large density
Aug 20, 2026
Focus Agent: LLM-Powered Virtual Focus Group
imitation-learning
Aug 20, 2026
Exploring utilization of generative AI for research and education in data-driven materials science
Aug 20, 2026
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
VLN
navigation
embodied-reasoning
Aug 20, 2026
Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
embodied-reasoning
agentic-RL
VLM
Aug 20, 2026
Evaluating Open-Source Vision-Language Models for Multimodal Sarcasm Detection
VLM
Aug 20, 2026
Electrooculography Dataset for Objective Spatial Navigation Assessment in Healthy Participants
navigation
Aug 20, 2026
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
VLM
navigation
imitation-learning
Aug 20, 2026
Editable Scene Simulation for Autonomous Driving via Collaborative LLM-Agents
LLM-agents
Aug 20, 2026
Using GUI Agent for Electronic Design Automation
GUI-Agent
Aug 20, 2026
CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI Automation
web-agent
Aug 20, 2026
Towards a Science of Scaling Agent Systems
LLM
task-planning
web-agent
Aug 20, 2026
DeBiasMe: De-biasing Human-AI Interactions with Metacognitive AIED (AI in Education) Interventions
Aug 20, 2026
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
scene-understanding
3D-representation
spatial-reasoning
Aug 20, 2026
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
imitation-learning
RL
Aug 20, 2026
Beyond principlism: Practical strategies for ethical AI use in research practices
Aug 20, 2026
Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation
navigation
imitation-learning
web-agent
Aug 20, 2026
Permission Manifests for Web Agents
web-agent
Aug 20, 2026
Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
VLM
imitation-learning
web-agent
Aug 20, 2026
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
VLA
manipulation
instruction-following
Aug 20, 2026
Auto-scaling Continuous Memory for GUI Agent
VLM
task-planning
web-agent
Aug 20, 2026
Augmenting the action space with conventions to improve multi-agent cooperation in Hanabi
manipulation
RL
task-planning
Aug 20, 2026
AUTO-Explorer: Automated Data Collection for GUI Agent
navigation
imitation-learning
scene-understanding
Aug 20, 2026
Android in the Zoo: Chain-of-Action-Thought for GUI Agents
GUI-Agent
Aug 20, 2026
AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents
scene-understanding
web-agent
Aug 20, 2026
ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay
VLA
imitation-learning
RL
Aug 20, 2026
OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents
computer-use
gui-agent
Aug 20, 2026
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
scene-understanding
web-agent
Aug 20, 2026
AOAD-MAT: Transformer-based multi-agent deep reinforcement learning model considering agents' order of action decisions
imitation-learning
RL
Aug 20, 2026
Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space
agentic-RL
LLM
RL
Aug 20, 2026
AMAP Agentic Planning Technical Report
imitation-learning
task-planning
web-agent
Aug 20, 2026
ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping
manipulation
3D-representation
world-model
Aug 20, 2026
Aligning Multimodal LLM with Human Preference: A Survey
imitation-learning
Aug 20, 2026
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
VLM
imitation-learning
RL
Aug 20, 2026
MP-GUI: Modality Perception with MLLMs for GUI Understanding
gui-agent
VLM
computer-use
Aug 20, 2026
Agent-Initiated Interaction in Phone UI Automation
VLM
scene-understanding
Aug 20, 2026
MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents
computer-use
gui-agent
Aug 20, 2026
SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM
SLAM
3D-representation
1-2
Aug 20, 2026
Motus: A Unified Latent Action World Model
VLA
world-model
flow-matching
Aug 20, 2026
Agent+P: Guiding UI Agents via Symbolic Planning
VLM
navigation
imitation-learning
Aug 20, 2026
LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment
VLM
imitation-learning
RL
Aug 20, 2026
A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation
imitation-learning
RL
web-agent
Aug 20, 2026
Go-Browse: Training Web Agents with Structured Exploration
web-agent
agentic-RL
Aug 20, 2026
MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
gui-agent
task-planning
instruction-following
Aug 20, 2026
GarmentPile: Point-Level Visual Affordance Guided Retrieval and Adaptation for Cluttered Garments Manipulation
manipulation
scene-understanding
spatial-reasoning
Aug 20, 2026
MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents
gui-agent
Aug 20, 2026
GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks
VLM
agentic-RL
embodied-reasoning
Aug 20, 2026
What Matters in Building Vision-Language-Action Models for Generalist Robots
VLA
manipulation
cross-embodiment
Aug 20, 2026
Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations
agentic-RL
LLM
Aug 20, 2026
FastVLM: Efficient Vision Encoding for Vision Language Models
VLM
Aug 20, 2026
MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval
LLM
agentic-RL
Aug 20, 2026
Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
GUI-Agent
Aug 20, 2026
Proposer-Agent-Evaluator (PAE): Autonomous Skill Discovery For Foundation Model Internet Agents
web-agent
agentic-RL
Aug 20, 2026
Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence
web-agent
navigation
task-planning
Aug 20, 2026
Mind to Hand: Purposeful Robotic Control via Embodied Reasoning
VLA
embodied-reasoning
manipulation
Aug 20, 2026
CogAgent: A Visual Language Model for GUI Agents
gui-agent
VLM
computer-use
Aug 20, 2026
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
gui-agent
computer-use
VLM
Aug 20, 2026
Embodied Scene Understanding for Vision Language Models via MetaVQA
scene-understanding
spatial-reasoning
VLM
Aug 20, 2026
Deep Research Agents: A Systematic Examination And Roadmap
web-agent
deep-research
survey
information-seeking
multi-agent
Aug 20, 2026
An Embodied Generalist Agent in 3D World
VLA
scene-understanding
spatial-reasoning
data
Aug 20, 2026
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training
VLA
embodied-reasoning
flow-matching
Aug 20, 2026
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
VLN
VLA
navigation
legged
Aug 20, 2026
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
GAIA: a benchmark for General AI Assistants
web-agent
benchmark
deep-research
tool-use
evaluation
Aug 20, 2026
AutoDroid-V2: Boosting SLM-based GUI Agents via Code Generation
web-agent
Aug 20, 2026
Autonomous Large Language Model Agents Enabling Intent-Driven Mobile GUI Testing
Aug 20, 2026
Learning Foresightful Dense Visual Affordance for Deformable Object Manipulation
manipulation
scene-understanding
Aug 20, 2026
AffordDP: Generalizable Diffusion Policy with Transferable Affordance
diffusion-policy
manipulation
spatial-reasoning
Aug 20, 2026
GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators
agentic-RL
LLM
Aug 20, 2026
WebDancer: Towards Autonomous Information Seeking Agency
web-agent
deep-research
information-seeking
reinforcement-learning
react
Aug 20, 2026
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
VLN
navigation
task-planning
1/2
Aug 20, 2026
FoldAct: Efficient and Stable Context Folding for Long-Horizon Search Agents
deep-research
agentic-RL
LLM
Aug 20, 2026
MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
gui-agent
agentic-RL
Aug 20, 2026
ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning
scene-understanding
task-planning
SLAM
Aug 20, 2026
Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis
gui-agent
computer-use
Aug 20, 2026
GEM: Gaussian Embedding Modeling for Out-of-Distribution Detection in GUI Agents
GUI-Agent
Aug 20, 2026
EVA: Red-Teaming GUI Agents via Evolving Indirect Prompt Injection
GUI-Agent
Aug 20, 2026
Free Process Rewards without Process Labels
agentic-RL
LLM
RL
Aug 20, 2026
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
VLN
navigation
video-LLM
Train
Samples
Trajectories
Token
Infer
Aug 20, 2026
WebArena: A Realistic Web Environment for Building Autonomous Agents
web-agent
LLM
computer-use
Aug 20, 2026
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
GUI-Agent
Aug 20, 2026
DreamGen: Unlocking Generalization in Robot Learning through Video World Models
world-model
VLA
manipulation
Aug 20, 2026
The BrowserGym Ecosystem for Web Agent Research
web-agent
gui-agent
computer-use
Aug 20, 2026
Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents
agentic-RL
LLM
auto-research
Aug 20, 2026
ETP-R1: Evolving Topological Planning with Reinforcement Fine-tuning for Vision-Language Navigation in Continuous Environments
VLN
navigation
agentic-RL
Aug 20, 2026
AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials
web-agent
gui-agent
VLM
Aug 20, 2026
BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
gui-agent
agentic-RL
Aug 20, 2026
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
VLM
computer-use
Aug 20, 2026
VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models
manipulation
task-planning
scene-understanding
Aug 20, 2026
AgentProg: Empowering Long-Horizon GUI Agents with Program-Guided Context Management
gui-agent
task-planning
Aug 20, 2026
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
web-agent
LLM
Aug 20, 2026
Understanding World or Predicting Future? A Comprehensive Survey of World Models
world-model
VLA
RL
Aug 20, 2026
Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory
agentic-RL
task-planning
Aug 20, 2026
WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks
web-agent
safety
prompt-injection
benchmark
security
Aug 20, 2026
Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation
Vision-Language-Model
Aug 20, 2026
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning
web-agent
reinforcement-learning
curriculum-learning
self-evolving
llm-agent
Aug 20, 2026
Prune4Web: DOM Tree Pruning Programming for Web Agent
web-agent
gui-agent
Aug 20, 2026
Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents
web-agent
world-model
task-planning
Aug 20, 2026
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
VLA
manipulation
embodied-reasoning
Aug 20, 2026
Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets
world-model
diffusion-policy
manipulation
imitation-learning
Aug 20, 2026
π*₀.₆: a VLA That Learns From Experience
VLA
RL
manipulation
flow-matching
Aug 20, 2026
Reward Hacking in Reinforcement Learning
agentic-RL
RL
LLM
Aug 20, 2026
HomeRobot: Open-Vocabulary Mobile Manipulation
mobile-manipulation
navigation
manipulation
scene-understanding
Aug 20, 2026
The Obvious Invisible Threat: LLM-Powered GUI Agents' Vulnerability to Fine-Print Injections
GUI-Agent
Aug 20, 2026
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills
web-agent
self-improving
skill-induction
memory
llm-agent
Aug 20, 2026
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
VLM
LLM
Aug 20, 2026
ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use
gui-agent
computer-use
Aug 20, 2026
GUI Agents with Foundation Models: A Comprehensive Survey
web-agent
Aug 20, 2026
Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence
VLA
spatial-reasoning
agentic-RL
Aug 20, 2026
TidyBot: Personalized Robot Assistance with Large Language Models
LLM
mobile-manipulation
scene-understanding
instruction-following
Aug 20, 2026
REAL: Benchmarking Autonomous Agents on Deterministic Simulations of Real Websites
web-agent
Aug 20, 2026
Large Language Model-Brained GUI Agents: A Survey
gui-agent
computer-use
agentic-RL
Aug 20, 2026
The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
navigation
imitation-learning
web-agent
Aug 20, 2026
OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection
scene-understanding
RL
Aug 20, 2026
π0.5: a Vision-Language-Action Model with Open-World Generalization
VLA
manipulation
mobile-manipulation
cross-embodiment
Aug 20, 2026
π0: A Vision-Language-Action Flow Model for General Robot Control
VLA
flow-matching
cross-embodiment
Aug 20, 2026
Reasoning with Language Model is Planning with World Model
LLM
task-planning
world-model
Aug 20, 2026
An Illusion of Progress? Assessing the Current State of Web Agents
web-agent
benchmark
evaluation
llm-as-judge
reliability
Aug 20, 2026
OS-ATLAS: A Foundation Action Model for Generalist GUI Agents
gui-agent
computer-use
VLM
Elements
Aug 20, 2026
NNetNav: Unsupervised Learning of Browser Agents Through Environment Interaction in the Wild
web-agent
agentic-RL
Aug 20, 2026
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
spatial-reasoning
embodied-reasoning
video-LLM
agentic-RL
Aug 20, 2026
NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models
VLN
LLM
navigation
Aug 20, 2026
MiMo-Embodied: X-Embodied Foundation Model Technical Report
VLM
embodied-reasoning
spatial-reasoning
Aug 20, 2026
LAPA: Latent Action Pretraining from Videos
VLA
world-model
imitation-learning
Aug 20, 2026
BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents
web-agent
benchmark
deep-research
information-seeking
evaluation
Aug 20, 2026
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
VLN
navigation
spatial-memory
Aug 20, 2026
ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning
web-agent
agentic-RL
Aug 20, 2026
Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents
computer-use
gui-agent
task-planning
Aug 20, 2026
Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
agentic-RL
LLM
Aug 20, 2026
Dynamic Open-Vocabulary 3D Scene Graphs for Long-term Language-Guided Mobile Manipulation
mobile-manipulation
scene-understanding
semantic-map
task-planning
Aug 20, 2026
AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
web-agent
agentic-RL
Aug 20, 2026
A Survey of WebAgents: Towards Next-Generation AI Agents for Web Automation with Large Foundation Models
web-agent
survey
llm-agent
web-automation
Aug 20, 2026
PaLM-E: An Embodied Multimodal Language Model
VLM
embodied-reasoning
task-planning
Aug 20, 2026
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
gui-agent
VLM
computer-use
Aug 20, 2026
Grounding Computer Use Agents on Human Demonstrations
gui-agent
computer-use
agentic-RL
AvgE
Aug 20, 2026
BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation
mobile-manipulation
embodied-reasoning
task-planning
Aug 20, 2026
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
diffusion-policy
imitation-learning
manipulation
Aug 20, 2026
VGGT: Visual Geometry Grounded Transformer
3D-representation
Aug 20, 2026
Towards The Ultimate Brain: Exploring Scientific Discovery with ChatGPT AI
imitation-learning
auto-research
Aug 20, 2026
AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents
gui-agent
web-agent
Aug 20, 2026
Enabling the Deployment of Any-Scale Robotic Applications in Microservice Architectures through Automated Containerization
Aug 20, 2026
Collaborative Dynamic 3D Scene Graphs for Automated Driving
scene-understanding
3D-representation
semantic-map
Aug 20, 2026
Automation and AI Technology in Surface Mining With a Brief Introduction to Open-Pit Operations in the Pilbara
navigation
Aug 20, 2026
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
VLN
navigation
instruction-following
Aug 20, 2026
GEN-0: Embodied Foundation Models That Scale with Physical Interaction
VLA
cross-embodiment
manipulation
Aug 20, 2026
A Survey on (M)LLM-Based GUI Agents
VLA
navigation
imitation-learning
Aug 20, 2026
WindowsAgentArena: Evaluating Multi-Modal OS Agents at Scale
computer-use
gui-agent
Aug 20, 2026
OS-Kairos: Adaptive Interaction for MLLM-Powered GUI Agents
GUI-Agent
Aug 20, 2026
RT-1: Robotics Transformer for Real-World Control at Scale
VLA
manipulation
imitation-learning
Aug 20, 2026
MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation
mobile-manipulation
VLA
manipulation
Aug 20, 2026
EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation
mobile-manipulation
VLA
spatial-memory
Aug 20, 2026
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
VLA
diffusion-policy
manipulation
Aug 20, 2026
Visual Language Maps for Robot Navigation
semantic-map
navigation
scene-understanding
Aug 20, 2026
Hyperbolic Attention Networks for Long-Range Dependencies
hyperbolic
attention
transformer
long-range
Aug 20, 2026
Accelerating OCR-Based Widget Localization for Test Automation of GUI Applications
Aug 20, 2026
Scaling Agent Learning via Experience Synthesis
agentic-RL
world-model
web-agent
Aug 20, 2026
The Impact of Element Ordering on LM Agent Performance
gui-agent
web-agent
VLM
Aug 20, 2026
EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage
web-agent
safety
prompt-injection
privacy
security
Aug 20, 2026
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
VLA
diffusion-policy
manipulation
Aug 20, 2026
Agent Workflow Memory
web-agent
memory
self-improving
workflow
llm-agent
Aug 20, 2026
Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
task-planning
instruction-following
mobile-manipulation
1/3
Aug 20, 2026
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
VLA
cross-embodiment
flow-matching
2-4
Aug 20, 2026
OmniParser for Pure Vision Based GUI Agent
gui-agent
computer-use
VLM
1/3
Aug 20, 2026
Virtual Mouse using Machine Learning and GUI Automation
imitation-learning
Aug 20, 2026
WebServ: A Browser-Server Environment for Efficient Training of Reinforcement Learning-based Web Agents at Scale
web-agent
agentic-RL
Aug 20, 2026
Gemini Robotics: Bringing AI into the Physical World
VLA
manipulation
embodied-reasoning
Aug 20, 2026
WalkVLM: Aid Visually Impaired People Walking by Vision Language Model
VLM
navigation
embodied-reasoning
Aug 20, 2026
Visual Test-time Scaling for GUI Agent Grounding
gui-agent
computer-use
VLM
Aug 20, 2026
Think Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation
VLN
navigation
spatial-memory
Aug 20, 2026
Diffusion Models Are Real-Time Game Engines
world-model
video-understanding
Aug 20, 2026
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
VLA
manipulation
imitation-learning
Aug 20, 2026
HMI Development Automation with GUI Elements for Object-Oriented Programming Languages Implementation
Aug 20, 2026
VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
VLM
video-understanding
spatial-reasoning
Aug 20, 2026
Designing Heterogeneous LLM Agents for Financial Sentiment Analysis
Aug 20, 2026
A Survey of Multi-Agent Deep Reinforcement Learning with Communication
RL
Aug 20, 2026
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
web-agent
agentic-RL
Aug 20, 2026
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
VLA
manipulation
cross-embodiment
Aug 20, 2026
Rich Screen Reader Experiences for Accessible Data Visualization
navigation
imitation-learning
scene-understanding
Aug 20, 2026
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
GUI-Agent
Aug 20, 2026
‘More like a person than reading text in a machine’: Characterizing User Choice of Embodied Agents vs. Conventional GUIs on Smartphones
GUI-Agent
Aug 20, 2026
MULANE - A Lightweight Extendable Agent-oriented LoRaWAN Simulator with GUI
GUI-Agent
Aug 20, 2026
Evaluation of the Choice of LLM in a Multi-Agent Solution for GUI-Test Generation
Aug 20, 2026
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
VLA
embodied-reasoning
flow-matching
Aug 20, 2026
Model Compression with Adversarial Robustness: A Unified Optimization Framework
GUI-Agent
Aug 20, 2026
A Systematic Literature Review of Automated Techniques for Functional GUI Testing of Mobile Applications
GUI-Agent
Aug 20, 2026
Inventions on selecting GUI elements
GUI-Agent
Aug 20, 2026
Agent. GUI: A multi-agent based simulation framework
GUI-Agent
Aug 20, 2026
Multi-Modal Repairs of Conversational Breakdowns in Task-Oriented Dialogs
Aug 20, 2026
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
VLN
navigation
VLM
Aug 20, 2026
Developing Multi‐Agent Systems with JADE
GUI-Agent
Aug 20, 2026
Agents and GUIs from task models
GUI-Agent
Aug 20, 2026
LLMs as Scalable, General-Purpose Simulators For Evolving Digital Agent Training
web-agent
world-model
gui-agent
Aug 20, 2026
PUMICE: A Multi-Modal Agent that Learns Concepts and Conditionals from Natural Language and Demonstrations
imitation-learning
Aug 20, 2026
How game complexity affects the playing behavior of synthetic agents
imitation-learning
Aug 20, 2026
Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning
embodied-reasoning
VLM
spatial-reasoning
Aug 20, 2026
GUI for the communication agent of the “Nephele” data center
Aug 20, 2026
Poincaré Embeddings for Learning Hierarchical Representations
hyperbolic
embedding
manifold
hierarchy
Aug 20, 2026
sdm: a reproducible and extensible R platform for species distribution modelling
Aug 20, 2026
Inventions on GUI Aesthetics
navigation
Aug 20, 2026
A Methodology to Engineer and Validate Dynamic Multi-level Multi-agent Based Simulations
Aug 20, 2026
Tree Search for Language Model Agents
web-agent
task-planning
Aug 20, 2026
UINavBench: A Framework for Comprehensive Evaluation of Interactive Digital Agents
gui-agent
computer-use
VLM
Aug 20, 2026
3D Slicer as an image computing platform for the Quantitative Imaging Network
Aug 20, 2026
ATLaS: Agent Tuning via Learning Critical Steps
LLM
imitation-learning
Aug 20, 2026
Intelligent Multiagent Control System for Energy and Comfort Management in Smart and Sustainable Buildings
Aug 20, 2026
Study Paper on Test Case generation for GUI Based Testing
Aug 20, 2026
Progress or Regress? Self-Improvement Reversal in Post-training
agentic-RL
LLM
Aug 20, 2026
Sikuli: Using GUI Screenshots for Search and Automation
gui-agent
computer-use
Aug 20, 2026
Building trustworthy software agents
Aug 20, 2026
VL-Nav: A Neuro-Symbolic Approach for Reasoning-based Vision-Language Navigation
VLN
navigation
task-planning
Aug 20, 2026
From Alife Agents to a Kingdom of N Queens
Aug 20, 2026
The Unreasonable Effectiveness of Scaling Agents for Computer Use
computer-use
gui-agent
LLM
Aug 20, 2026
Robotic Control via Embodied Chain-of-Thought Reasoning
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Scalable Hyperbolic Representation Learning for Large-Scale Knowledge Graphs
hyperbolic
knowledge-graph
scalable
embedding
Aug 20, 2026
R-WoM: Retrieval-augmented World Model For Computer-use Agents
computer-use
world-model
web-agent
Aug 20, 2026
RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
embodied-reasoning
manipulation
task-planning
Aug 20, 2026
AI Agents That Matter
LLM
web-agent
Aug 20, 2026
RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping
manipulation
embodied-reasoning
scene-understanding
Aug 20, 2026
Riemannian Optimization on Fixed-Rank Matrix Manifolds
riemannian
manifold
fixed-rank
optimization
Aug 20, 2026
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
VLM
video-understanding
video-LLM
Aug 20, 2026
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
video-LLM
video-understanding
VLM
Aug 20, 2026
Versatile Navigation under Partial Observability via Value-guided Diffusion Policy
navigation
diffusion-policy
Aug 20, 2026
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
VLA
imitation-learning
manipulation
Aug 20, 2026
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
computer-use
gui-agent
Aug 20, 2026
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
VLA
manipulation
embodied-reasoning
Aug 20, 2026
NaviTrace: Evaluating Embodied Navigation of Vision-Language Models
navigation
VLM
embodied-reasoning
Aug 20, 2026
MapNav: A Novel Memory Representation via Annotated Semantic Maps for VLM-based Vision-and-Language Navigation
VLN
semantic-map
spatial-memory
Aug 20, 2026
MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation
mobile-manipulation
navigation
scene-understanding
Aug 20, 2026
InSTA: Towards Internet-Scale Training For Agents
web-agent
agentic-RL
Aug 20, 2026
OpenVLA: An Open-Source Vision-Language-Action Model
VLA
manipulation
cross-embodiment
Aug 20, 2026
Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks
deep-research
agentic-RL
LLM
Aug 20, 2026
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
VLA
instruction-following
task-planning
manipulation
embodied-reasoning
Aug 20, 2026
MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
VLM
Aug 20, 2026
Investigating Compositional Challenges in Vision-Language Models for Visual Grounding
VLM
scene-understanding
Aug 20, 2026
MGA: Memory-Driven GUI Agent for Observation-Centric Interaction
gui-agent
computer-use
Aug 20, 2026
Learning Precise Affordances from Egocentric Videos for Robotic Manipulation
manipulation
scene-understanding
spatial-reasoning
Aug 20, 2026
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation
VLA
manipulation
task-planning
Aug 20, 2026
IRASim: A Fine-Grained World Model for Robot Manipulation
world-model
manipulation
diffusion-policy
Aug 20, 2026
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
video-LLM
video-understanding
VLM
Aug 20, 2026
Explorer: Scaling Exploration-driven Web Trajectory Synthesis for Multimodal Web Agents
web-agent
Aug 20, 2026
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
gui-agent
VLM
computer-use
Aug 20, 2026
Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic Manipulation
diffusion-policy
manipulation
task-planning
Aug 20, 2026
Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine
agentic-RL
LLM
auto-research
Aug 20, 2026
Dual-View Visual Contextualization for Web Navigation
web-agent
gui-agent
VLM
Aug 20, 2026
HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation
world-model
scene-understanding
3D-representation
Aug 20, 2026
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
embodied-reasoning
VLM
task-planning
Env
Tasks
Aug 20, 2026
Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation
web-agent
gui-agent
Aug 20, 2026
On the Effects of Data Scale on UI Control Agents
gui-agent
computer-use
Aug 20, 2026
Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer
VLA
cross-embodiment
embodied-reasoning
Aug 20, 2026
AutoRepo: A general framework for multimodal LLM-based automated construction reporting
Aug 20, 2026
Digi-Q: Learning Q-Value Functions for Training Device-Control Agents
gui-agent
agentic-RL
RL
Aug 20, 2026
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation
Multimodal-LLM
Aug 20, 2026
Accelerated Riemannian Optimization: Handling Multiple Geometric Constraints
riemannian
optimization
manifold
geometric-constraints
Aug 20, 2026
An Interactive Navigation Method with Effect-oriented Affordance
navigation
spatial-reasoning
semantic-map
Aug 20, 2026
FocusAgent: Simple Yet Effective Ways of Trimming the Large Context of Web Agents
web-agent
gui-agent
Aug 20, 2026
FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation
VLA
manipulation
Aug 20, 2026
EmbodiedSplat: Personalized Real-to-Sim-to-Real Navigation with Gaussian Splats from a Mobile Device
navigation
3D-representation
Aug 20, 2026
Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
world-model
Aug 20, 2026
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
computer-use
gui-agent
VLM
Aug 20, 2026
EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence
embodied-reasoning
task-planning
agentic-RL
Aug 20, 2026
A Survey on Vision-Language-Action Models for Embodied AI
VLA
task-planning
manipulation
Aug 20, 2026
Robotic World Model: A Neural Network Simulator for Robust Policy Optimization in Robotics
world-model
RL
legged
Aug 20, 2026
Octo: An Open-Source Generalist Robot Policy
VLA
diffusion-policy
cross-embodiment
manipulation
Aug 20, 2026
A Survey on Efficient Vision-Language-Action Models
VLA
manipulation
Aug 20, 2026
INREACT: An Inspire-Then-Reinforce Training Framework For Multimodal GUI Agent
web-agent
Aug 20, 2026
InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
GUI-Agent
Aug 20, 2026
Scaling Long-Horizon LLM Agent via Context-Folding
deep-research
agentic-RL
LLM
Aug 20, 2026
Hyperbolic Graph Contrastive Learning with Hierarchical Positives
hyperbolic
graph
contrastive-learning
hierarchy
Aug 20, 2026
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
world-model
3D-representation
Aug 20, 2026
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
VLA
embodied-reasoning
VLM
Aug 20, 2026
Lorentz Graph Neural Networks
lorentz
graph-neural-network
equivariant
hyperbolic
Aug 20, 2026
LLMs Meet Multimodal Generation and Editing: A Survey
Multimodal-LLM
Aug 20, 2026
Cosmos World Foundation Model Platform for Physical AI
world-model
VLA
manipulation
Aug 20, 2026
CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance
VLA
embodied-reasoning
spatial-reasoning
Aug 20, 2026
CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent
computer-use
agentic-RL
gui-agent
Aug 20, 2026
CAPTURE: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
spatial-reasoning
VLM
Aug 20, 2026
Diffusion for World Modeling: Visual Details Matter in Atari
world-model
RL
diffusion-policy
Superhuman
Aug 20, 2026
Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action Memory
web-agent
task-planning
Aug 20, 2026
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
VLA
scene-understanding
embodied-reasoning
Aug 20, 2026
Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
agentic-RL
LLM
Aug 20, 2026
Toward Systems Foundations for Agentic Exploration
computer-use
LLM
Aug 20, 2026
AOAD-MAT: Transformer-based multi-agent deep reinforcement learning model considering agents' order of action decisions
GUI-Agent
Aug 20, 2026
A0: An Affordance-Aware Hierarchical Model for General Robotic Manipulation
manipulation
spatial-reasoning
VLA
Aug 20, 2026
Rho-1: Not All Tokens Are What You Need
LLM
Aug 20, 2026
A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions
computer-use
gui-agent
web-agent
Aug 20, 2026
WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning
web-agent
deep-research
information-seeking
reinforcement-learning
synthetic-data
Aug 20, 2026
White-Box AI Model: Next Frontier of Wireless Communications
imitation-learning
RL
Aug 20, 2026
A Survey on Self-Evolution of Large Language Models
LLM
agentic-RL
Aug 20, 2026
Web-CogReasoner: Towards Knowledge-Induced Cognitive Reasoning for Web Agents
VLM
imitation-learning
scene-understanding
Aug 20, 2026
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
gui-agent
computer-use
agentic-RL
1-2
Aug 20, 2026
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
VLM
imitation-learning
Aug 20, 2026
WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?
web-agent
benchmark
enterprise
knowledge-work
evaluation
Aug 20, 2026
VeriSafe Agent: Safeguarding Mobile GUI Agent via Logic-based Action Verification
imitation-learning
web-agent
Aug 20, 2026
UItron: Foundational GUI Agent with Advanced Perception and Planning
VLM
navigation
imitation-learning
Aug 20, 2026
VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View
navigation
Aug 20, 2026
UISim: An Interactive Image-Based UI Simulator for Dynamic Mobile Environments
navigation
task-planning
Aug 20, 2026
Tree Search for LLM Agent Reinforcement Learning (Tree-GRPO)
agentic-RL
LLM