DeepRead
Search
Search
Dark mode
Light mode
Explorer
Popular Tags
#VLM
#agentic-RL
#gui-agent
#web-agent
#LLM
#VLA
#computer-use
#task-planning
#manipulation
#imitation-learning
Tag: VLA
156 items with this tag.
Aug 20, 2026
World Model Survey
world-model
agent
simulation
planning
MBRL
VLA
diffusion-policy
cross-embodiment
Aug 20, 2026
Vision-Language-Action Models
VLA
manipulation
embodied-reasoning
Aug 20, 2026
Embodied AI Survey
survey
VLA
manipulation
navigation
embodied-ai
robotics
embodied-reasoning
mobile-manipulation
Aug 20, 2026
面向云手机复杂任务的高效可靠 GUI VLA 模型技术报告
report
gui-agent
VLA
cloud-phone
reliability
efficient-inference
Aug 20, 2026
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
VLA
VLM
manipulation
Aug 20, 2026
How Should Vision-Language-Action Models Use Proprioceptive State?
VLA
manipulation
flow-matching
Aug 20, 2026
MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight
world-model
mobile-manipulation
VLA
Aug 20, 2026
In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models
VLA
instruction-following
manipulation
Aug 20, 2026
CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention
VLA
manipulation
flow-matching
Aug 20, 2026
Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning
manipulation
VLA
RL
Aug 20, 2026
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
VLA
mobile-manipulation
cross-embodiment
Aug 20, 2026
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
VLA
RL
world-model
Aug 20, 2026
VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
VLA
manipulation
flow-matching
Aug 20, 2026
N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
VLA
manipulation
RL
Aug 20, 2026
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
VLA
manipulation
imitation-learning
Aug 20, 2026
Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms
VLA
Aug 20, 2026
Learning to Move Before Learning to Do: Task-Agnostic Pretraining for VLAs
imitation-learning
VLA
Aug 20, 2026
SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation
VLA
flow-matching
manipulation
Aug 20, 2026
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
world-model
manipulation
VLA
Aug 20, 2026
STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation
world-model
VLA
manipulation
diffusion-policy
Aug 20, 2026
On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation
VLA
manipulation
flow-matching
Aug 20, 2026
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
VLA
manipulation
diffusion-policy
Aug 20, 2026
π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
VLA
manipulation
cross-embodiment
Aug 20, 2026
Privileged Foresight Distillation: Zero-Cost Future Correction for World Action Models
world-model
VLA
manipulation
Aug 20, 2026
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
imitation-learning
VLA
manipulation
Aug 20, 2026
RhinoVLA Technical Report
VLA
cross-embodiment
flow-matching
manipulation
Aug 20, 2026
M²-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills
VLA
world-model
manipulation
embodied-AI
Aug 20, 2026
Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
VLA
manipulation
diffusion-policy
Aug 20, 2026
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
world-model
manipulation
VLA
Aug 20, 2026
RehearseVLA: Simulated Post-Training for VLAs with Physically-Consistent World Model
VLA
world-model
agentic-RL
Aug 20, 2026
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
VLM
spatial-reasoning
VLA
Aug 20, 2026
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
VLA
embodied-reasoning
task-planning
Aug 20, 2026
FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
world-model
manipulation
VLA
Aug 20, 2026
Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models
VLA
task-planning
manipulation
Aug 20, 2026
Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
VLA
world-model
manipulation
Aug 20, 2026
GEN-1: Scaling Embodied Foundation Models to Mastery
VLA
manipulation
imitation-learning
Aug 20, 2026
EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
VLA
manipulation
imitation-learning
Aug 20, 2026
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models
VLA
manipulation
Aug 20, 2026
DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation
manipulation
world-model
VLA
Aug 20, 2026
Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
VLA
cross-embodiment
Aug 20, 2026
PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation
VLA
world-model
manipulation
Aug 20, 2026
Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
VLA
imitation-learning
manipulation
Aug 20, 2026
PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
Orca: The World is in Your Mind
world-model
VLM
VLA
Aug 20, 2026
ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
world-model
VLA
mobile-manipulation
Aug 20, 2026
Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining
VLA
imitation-learning
world-model
Aug 20, 2026
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
VLA
agentic-RL
instruction-following
Aug 20, 2026
AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding
VLA
manipulation
spatial-reasoning
Aug 20, 2026
Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation
VLA
world-model
navigation
UAV
Aug 20, 2026
Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning
VLA
world-model
embodied-reasoning
task-planning
Aug 20, 2026
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
VLA
manipulation
3D-representation
Aug 20, 2026
Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models
VLA
embodied-reasoning
VLM
Aug 20, 2026
World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
VLA
world-model
embodied-reasoning
manipulation
Aug 20, 2026
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
VLA
manipulation
Aug 20, 2026
MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent
VLA
manipulation
cross-embodiment
Aug 20, 2026
WALL-WM: Carving World Action Modeling at the Event Joints
world-model
VLA
manipulation
embodied-reasoning
Aug 20, 2026
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
VLA
world-model
action-generation
efficiency
Aug 20, 2026
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
VLA
manipulation
embodied-reasoning
Aug 20, 2026
BiCoord: A Bimanual Manipulation Benchmark towards Long-Horizon Spatial-Temporal Coordination
manipulation
VLA
diffusion-policy
Aug 20, 2026
Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation
VLA
world-model
manipulation
Aug 20, 2026
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation
manipulation
scene-understanding
spatial-reasoning
VLA
Aug 20, 2026
3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training
VLA
spatial-reasoning
manipulation
3D-representation
Aug 20, 2026
Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model
VLA
flow-matching
manipulation
Aug 20, 2026
LARA: Latent Action Representation Alignment for Vision-Language-Action Models
VLA
imitation-learning
world-model
flow-matching
Aug 20, 2026
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
VLA
mobile-manipulation
imitation-learning
Aug 20, 2026
Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
agentic-RL
VLA
task-planning
Aug 20, 2026
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
VLA
manipulation
task-planning
Aug 20, 2026
HybridDriveVLA: Vision-Language-Action Model with Visual CoT reasoning and ToT Evaluation for Autonomous Driving
VLA
embodied-reasoning
world-model
Aug 20, 2026
TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies
VLA
manipulation
imitation-learning
Aug 20, 2026
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic–Spatial Fusion and Latent Predictive Representation
VLN
VLA
world-model
spatial-reasoning
Ep
Aug 20, 2026
TRM-VLA: Temporal-Aware Chain-of-Thought Reasoning and Memorization for Vision-Language-Action Models
VLA
embodied-reasoning
manipulation
Aug 20, 2026
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
VLA
world-model
manipulation
Aug 20, 2026
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
VLA
manipulation
Aug 20, 2026
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
VLA
imitation-learning
manipulation
Aug 20, 2026
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
VLA
manipulation
Aug 20, 2026
GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
VLA
manipulation
3D-representation
Aug 20, 2026
GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models
VLA
manipulation
spatial-reasoning
Aug 20, 2026
OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
world-model
manipulation
VLA
Aug 20, 2026
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
VLA
manipulation
diffusion-policy
Aug 20, 2026
MolmoAct2: Action Reasoning Models for Real-world Deployment
VLA
embodied-reasoning
manipulation
Aug 20, 2026
GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors
imitation-learning
manipulation
VLA
3D-representation
Aug 20, 2026
From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
VLA
manipulation
embodied-reasoning
Aug 20, 2026
ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments
VLA
cross-embodiment
spatial-reasoning
Aug 20, 2026
Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution
VLA
manipulation
flow-matching
Aug 20, 2026
Pure Vision-Language-Action (VLA) Models: A Comprehensive Survey
VLA
manipulation
embodied-reasoning
Aug 20, 2026
World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy
world-model
VLA
agentic-RL
Aug 20, 2026
Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation
VLA
embodied-reasoning
manipulation
Aug 20, 2026
ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation
VLA
3D-representation
spatial-reasoning
manipulation
Aug 20, 2026
RynnBrain: Open Embodied Foundation Models
VLA
spatial-reasoning
task-planning
Aug 20, 2026
AnywhereVLA: Language-Conditioned Exploration and Mobile Manipulation
mobile-manipulation
VLA
SLAM
Aug 20, 2026
RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation
VLA
manipulation
embodied-reasoning
Aug 20, 2026
GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning
VLA
world-model
manipulation
Aug 20, 2026
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
embodied-reasoning
VLA
agentic-RL
manipulation
spatial-reasoning
Aug 20, 2026
World Action Models are Zero-shot Policies
world-model
VLA
manipulation
cross-embodiment
Aug 20, 2026
DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI
VLA
manipulation
navigation
mobile-manipulation
1/2/3
Aug 20, 2026
RoboBrain 2.5: Depth in Sight, Time in Mind
spatial-reasoning
VLA
RL
Aug 20, 2026
RT-H: Action Hierarchies Using Language
VLA
imitation-learning
instruction-following
Aug 20, 2026
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
VLA
embodied-reasoning
manipulation
Aug 20, 2026
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
VLN
video-LLM
VLA
navigation
Aug 20, 2026
CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding
VLA
manipulation
embodied-reasoning
LLM-subtasks
gripper-state-segments
Aug 20, 2026
A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning
VLA
RL
web-agent
Aug 20, 2026
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
VLA
spatial-reasoning
embodied-reasoning
Aug 20, 2026
LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation
VLA
navigation
imitation-learning
Aug 20, 2026
MobileFlow: A Multimodal LLM For Mobile GUI Agent
VLM
VLA
scene-understanding
Aug 20, 2026
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
VLA
flow-matching
manipulation
Aug 20, 2026
WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control
VLA
mobile-manipulation
legged
Aug 20, 2026
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
VLA
manipulation
instruction-following
Aug 20, 2026
ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay
VLA
imitation-learning
RL
Aug 20, 2026
Motus: A Unified Latent Action World Model
VLA
world-model
flow-matching
Aug 20, 2026
What Matters in Building Vision-Language-Action Models for Generalist Robots
VLA
manipulation
cross-embodiment
Aug 20, 2026
Mind to Hand: Purposeful Robotic Control via Embodied Reasoning
VLA
embodied-reasoning
manipulation
Aug 20, 2026
An Embodied Generalist Agent in 3D World
VLA
scene-understanding
spatial-reasoning
data
Aug 20, 2026
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training
VLA
embodied-reasoning
flow-matching
Aug 20, 2026
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
VLN
VLA
navigation
legged
Aug 20, 2026
DreamGen: Unlocking Generalization in Robot Learning through Video World Models
world-model
VLA
manipulation
Aug 20, 2026
Understanding World or Predicting Future? A Comprehensive Survey of World Models
world-model
VLA
RL
Aug 20, 2026
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
VLA
manipulation
embodied-reasoning
Aug 20, 2026
π*₀.₆: a VLA That Learns From Experience
VLA
RL
manipulation
flow-matching
Aug 20, 2026
Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence
VLA
spatial-reasoning
agentic-RL
Aug 20, 2026
π0.5: a Vision-Language-Action Model with Open-World Generalization
VLA
manipulation
mobile-manipulation
cross-embodiment
Aug 20, 2026
π0: A Vision-Language-Action Flow Model for General Robot Control
VLA
flow-matching
cross-embodiment
Aug 20, 2026
LAPA: Latent Action Pretraining from Videos
VLA
world-model
imitation-learning
Aug 20, 2026
GEN-0: Embodied Foundation Models That Scale with Physical Interaction
VLA
cross-embodiment
manipulation
Aug 20, 2026
A Survey on (M)LLM-Based GUI Agents
VLA
navigation
imitation-learning
Aug 20, 2026
RT-1: Robotics Transformer for Real-World Control at Scale
VLA
manipulation
imitation-learning
Aug 20, 2026
MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation
mobile-manipulation
VLA
manipulation
Aug 20, 2026
EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation
mobile-manipulation
VLA
spatial-memory
Aug 20, 2026
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
VLA
diffusion-policy
manipulation
Aug 20, 2026
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
VLA
diffusion-policy
manipulation
Aug 20, 2026
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
VLA
cross-embodiment
flow-matching
2-4
Aug 20, 2026
Gemini Robotics: Bringing AI into the Physical World
VLA
manipulation
embodied-reasoning
Aug 20, 2026
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
VLA
manipulation
imitation-learning
Aug 20, 2026
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
VLA
manipulation
cross-embodiment
Aug 20, 2026
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
VLA
embodied-reasoning
flow-matching
Aug 20, 2026
Robotic Control via Embodied Chain-of-Thought Reasoning
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
VLA
imitation-learning
manipulation
Aug 20, 2026
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
VLA
manipulation
embodied-reasoning
Aug 20, 2026
OpenVLA: An Open-Source Vision-Language-Action Model
VLA
manipulation
cross-embodiment
Aug 20, 2026
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
VLA
instruction-following
task-planning
manipulation
embodied-reasoning
Aug 20, 2026
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation
VLA
manipulation
task-planning
Aug 20, 2026
Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer
VLA
cross-embodiment
embodied-reasoning
Aug 20, 2026
FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation
VLA
manipulation
Aug 20, 2026
A Survey on Vision-Language-Action Models for Embodied AI
VLA
task-planning
manipulation
Aug 20, 2026
Octo: An Open-Source Generalist Robot Policy
VLA
diffusion-policy
cross-embodiment
manipulation
Aug 20, 2026
A Survey on Efficient Vision-Language-Action Models
VLA
manipulation
Aug 20, 2026
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
VLA
embodied-reasoning
VLM
Aug 20, 2026
Cosmos World Foundation Model Platform for Physical AI
world-model
VLA
manipulation
Aug 20, 2026
CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance
VLA
embodied-reasoning
spatial-reasoning
Aug 20, 2026
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
VLA
scene-understanding
embodied-reasoning
Aug 20, 2026
A0: An Affordance-Aware Hierarchical Model for General Robotic Manipulation
manipulation
spatial-reasoning
VLA
Jul 03, 2026
2026-07-03-Autoresearch-AllTopics-Update
computer-use
gui-agent
agentic-RL
VLA
world-model