DeepRead
Search
Search
Dark mode
Light mode
Explorer
Popular Tags
#VLM
#agentic-RL
#gui-agent
#web-agent
#LLM
#VLA
#computer-use
#task-planning
#manipulation
#imitation-learning
Tag: imitation-learning
103 items with this tag.
Aug 20, 2026
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
world-model
manipulation
imitation-learning
Aug 20, 2026
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
VLA
manipulation
imitation-learning
Aug 20, 2026
Learning to Move Before Learning to Do: Task-Agnostic Pretraining for VLAs
imitation-learning
VLA
Aug 20, 2026
Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation
diffusion-policy
manipulation
imitation-learning
Aug 20, 2026
Speculative Rollback Correction for Quality-Diverse Web Agent Imitation
web-agent
imitation-learning
gui-agent
Aug 20, 2026
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
imitation-learning
VLA
manipulation
Aug 20, 2026
Do as I Do: Dexterous Manipulation Data from Everyday Human Videos
imitation-learning
manipulation
3D-representation
Aug 20, 2026
GEN-1: Scaling Embodied Foundation Models to Mastery
VLA
manipulation
imitation-learning
Aug 20, 2026
EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
VLA
manipulation
imitation-learning
Aug 20, 2026
BiPreManip: Learning Affordance-Based Bimanual Preparatory Manipulation through Anticipatory Collaboration
manipulation
spatial-reasoning
imitation-learning
Aug 20, 2026
Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
VLA
imitation-learning
manipulation
Aug 20, 2026
Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining
VLA
imitation-learning
world-model
Aug 20, 2026
AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence
manipulation
imitation-learning
spatial-reasoning
Aug 20, 2026
Weasel: Out-of-Domain Generalization for Web Agents via Importance-Diversity Data Selection
web-agent
gui-agent
imitation-learning
Aug 20, 2026
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
gui-agent
VLM
imitation-learning
Aug 20, 2026
LARA: Latent Action Representation Alignment for Vision-Language-Action Models
VLA
imitation-learning
world-model
flow-matching
Aug 20, 2026
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
VLA
mobile-manipulation
imitation-learning
Aug 20, 2026
TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies
VLA
manipulation
imitation-learning
Aug 20, 2026
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
VLA
imitation-learning
manipulation
Aug 20, 2026
GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors
imitation-learning
manipulation
VLA
3D-representation
Aug 20, 2026
OpenCUA: Open Foundations for Computer-Use Agents
computer-use
gui-agent
VLM
imitation-learning
Aug 20, 2026
RT-H: Action Hierarchies Using Language
VLA
imitation-learning
instruction-following
Aug 20, 2026
UIPro: Unleashing Superior Interaction Capability For GUI Agents
VLM
imitation-learning
scene-understanding
Aug 20, 2026
UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning
imitation-learning
RL
scene-understanding
Aug 20, 2026
UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
navigation
imitation-learning
RL
Aug 20, 2026
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
VLM
imitation-learning
RL
Aug 20, 2026
SpiritSight Agent: Advanced GUI Agent with One Look
VLM
navigation
imitation-learning
Aug 20, 2026
ScaleTrack: Scaling and back-tracking Automated GUI Agents
imitation-learning
scene-understanding
web-agent
Aug 20, 2026
Retrieval-augmented GUI Agents with Generative Guidelines
VLM
imitation-learning
web-agent
Aug 20, 2026
ProBench: Benchmarking GUI Agents with Accurate Process Information
imitation-learning
web-agent
Aug 20, 2026
A Plan Reuse Mechanism for LLM-Driven Agent
imitation-learning
Aug 20, 2026
PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents
navigation
imitation-learning
task-planning
Aug 20, 2026
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
imitation-learning
RL
scene-understanding
Aug 20, 2026
Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation
mobile-manipulation
imitation-learning
manipulation
Aug 20, 2026
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
VLM
navigation
imitation-learning
Aug 20, 2026
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
navigation
imitation-learning
scene-understanding
Aug 20, 2026
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
VLM
imitation-learning
web-agent
Aug 20, 2026
MobileUse: A GUI Agent with Hierarchical Reflection for Autonomous Mobile Operation
navigation
imitation-learning
scene-understanding
Aug 20, 2026
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
VLM
imitation-learning
task-planning
Aug 20, 2026
WebCanvas: Benchmarking Web Agents in Online Environments
imitation-learning
RL
scene-understanding
Aug 20, 2026
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
VLM
imitation-learning
RL
Aug 20, 2026
M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
imitation-learning
web-agent
Aug 20, 2026
LLM-Powered GUI Agents in Phone Automation: Surveying Progress and Prospects
VLM
imitation-learning
RL
Aug 20, 2026
LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code
imitation-learning
Aug 20, 2026
LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation
VLA
navigation
imitation-learning
Aug 20, 2026
Less is More: Empowering GUI Agent with Context-Aware Simplification
navigation
imitation-learning
web-agent
Aug 20, 2026
LearnAct: Few-Shot Mobile GUI Agent with a Unified Demonstration Benchmark
imitation-learning
web-agent
Aug 20, 2026
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
imitation-learning
RL
web-agent
Aug 20, 2026
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
VLM
imitation-learning
scene-understanding
Aug 20, 2026
LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents
imitation-learning
scene-understanding
web-agent
Aug 20, 2026
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
VLM
imitation-learning
RL
Aug 20, 2026
Intelligent Interaction Strategies for Context-Aware Cognitive Augmentation
imitation-learning
Aug 20, 2026
Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
imitation-learning
scene-understanding
web-agent
Aug 20, 2026
History-Aware Reasoning for GUI Agents
imitation-learning
RL
task-planning
Aug 20, 2026
GUISpector: An MLLM Agent Framework for Automated Verification of Natural Language Requirements in GUI Prototypes
imitation-learning
Aug 20, 2026
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
navigation
imitation-learning
task-planning
Aug 20, 2026
Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic Manipulation
manipulation
diffusion-policy
imitation-learning
Aug 20, 2026
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies
imitation-learning
web-agent
Aug 20, 2026
GUI-ReWalk: Massive Data Generation for GUI Agent via Stochastic Exploration and Intent-Aware Reasoning
navigation
imitation-learning
task-planning
Aug 20, 2026
Large Language Model-Brained GUI Agents: A Survey
VLM
navigation
imitation-learning
Aug 20, 2026
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
VLM
imitation-learning
task-planning
Aug 20, 2026
Improved GUI Grounding via Iterative Narrowing
VLM
imitation-learning
RL
Aug 20, 2026
GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
VLM
navigation
imitation-learning
Aug 20, 2026
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
navigation
imitation-learning
web-agent
Aug 20, 2026
GUICourse: From General Vision Language Models to Versatile GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
imitation-learning
web-agent
Aug 20, 2026
Foundations of GenIR
VLM
imitation-learning
scene-understanding
Aug 20, 2026
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
imitation-learning
scene-understanding
web-agent
Aug 20, 2026
Focus Agent: LLM-Powered Virtual Focus Group
imitation-learning
Aug 20, 2026
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
VLM
navigation
imitation-learning
Aug 20, 2026
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
imitation-learning
RL
Aug 20, 2026
Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation
navigation
imitation-learning
web-agent
Aug 20, 2026
Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
VLM
imitation-learning
web-agent
Aug 20, 2026
AUTO-Explorer: Automated Data Collection for GUI Agent
navigation
imitation-learning
scene-understanding
Aug 20, 2026
ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay
VLA
imitation-learning
RL
Aug 20, 2026
AOAD-MAT: Transformer-based multi-agent deep reinforcement learning model considering agents' order of action decisions
imitation-learning
RL
Aug 20, 2026
AMAP Agentic Planning Technical Report
imitation-learning
task-planning
web-agent
Aug 20, 2026
Aligning Multimodal LLM with Human Preference: A Survey
imitation-learning
Aug 20, 2026
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
VLM
imitation-learning
RL
Aug 20, 2026
Agent+P: Guiding UI Agents via Symbolic Planning
VLM
navigation
imitation-learning
Aug 20, 2026
Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment
VLM
imitation-learning
RL
Aug 20, 2026
A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation
imitation-learning
RL
web-agent
Aug 20, 2026
Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets
world-model
diffusion-policy
manipulation
imitation-learning
Aug 20, 2026
The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
navigation
imitation-learning
web-agent
Aug 20, 2026
LAPA: Latent Action Pretraining from Videos
VLA
world-model
imitation-learning
Aug 20, 2026
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
diffusion-policy
imitation-learning
manipulation
Aug 20, 2026
Towards The Ultimate Brain: Exploring Scientific Discovery with ChatGPT AI
imitation-learning
auto-research
Aug 20, 2026
A Survey on (M)LLM-Based GUI Agents
VLA
navigation
imitation-learning
Aug 20, 2026
RT-1: Robotics Transformer for Real-World Control at Scale
VLA
manipulation
imitation-learning
Aug 20, 2026
Virtual Mouse using Machine Learning and GUI Automation
imitation-learning
Aug 20, 2026
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
VLA
manipulation
imitation-learning
Aug 20, 2026
Rich Screen Reader Experiences for Accessible Data Visualization
navigation
imitation-learning
scene-understanding
Aug 20, 2026
PUMICE: A Multi-Modal Agent that Learns Concepts and Conditionals from Natural Language and Demonstrations
imitation-learning
Aug 20, 2026
How game complexity affects the playing behavior of synthetic agents
imitation-learning
Aug 20, 2026
ATLaS: Agent Tuning via Learning Critical Steps
LLM
imitation-learning
Aug 20, 2026
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
VLA
imitation-learning
manipulation
Aug 20, 2026
White-Box AI Model: Next Frontier of Wireless Communications
imitation-learning
RL
Aug 20, 2026
Web-CogReasoner: Towards Knowledge-Induced Cognitive Reasoning for Web Agents
VLM
imitation-learning
scene-understanding
Aug 20, 2026
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
VLM
imitation-learning
Aug 20, 2026
VeriSafe Agent: Safeguarding Mobile GUI Agent via Logic-based Action Verification
imitation-learning
web-agent
Aug 20, 2026
UItron: Foundational GUI Agent with Advanced Perception and Planning
VLM
navigation
imitation-learning