DeepRead
Search
Search
Dark mode
Light mode
Explorer
Popular Tags
#VLM
#agentic-RL
#gui-agent
#web-agent
#LLM
#VLA
#computer-use
#task-planning
#manipulation
#imitation-learning
Tag: manipulation
138 items with this tag.
Aug 20, 2026
Vision-Language-Action Models
VLA
manipulation
embodied-reasoning
Aug 20, 2026
Embodied AI Survey
survey
VLA
manipulation
navigation
embodied-ai
robotics
embodied-reasoning
mobile-manipulation
Aug 20, 2026
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
VLA
VLM
manipulation
Aug 20, 2026
How Should Vision-Language-Action Models Use Proprioceptive State?
VLA
manipulation
flow-matching
Aug 20, 2026
In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models
VLA
instruction-following
manipulation
Aug 20, 2026
RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
world-model
manipulation
imitation-learning
Aug 20, 2026
CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention
VLA
manipulation
flow-matching
Aug 20, 2026
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
world-model
manipulation
flow-matching
Aug 20, 2026
Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning
manipulation
VLA
RL
Aug 20, 2026
World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models
world-model
task-planning
manipulation
Aug 20, 2026
VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
VLA
manipulation
flow-matching
Aug 20, 2026
N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
VLA
manipulation
RL
Aug 20, 2026
N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
world-model
manipulation
flow-matching
Aug 20, 2026
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
VLA
manipulation
imitation-learning
Aug 20, 2026
Tube Diffusion Policy: Reactive Visual-Tactile Policy Learning for Contact-rich Manipulation
diffusion-policy
world-model
manipulation
tactile
Aug 20, 2026
SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation
VLA
flow-matching
manipulation
Aug 20, 2026
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
world-model
manipulation
VLA
Aug 20, 2026
STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation
world-model
VLA
manipulation
diffusion-policy
Aug 20, 2026
Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation
diffusion-policy
manipulation
imitation-learning
Aug 20, 2026
On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation
VLA
manipulation
flow-matching
Aug 20, 2026
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
VLA
manipulation
diffusion-policy
Aug 20, 2026
π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
VLA
manipulation
cross-embodiment
Aug 20, 2026
Privileged Foresight Distillation: Zero-Cost Future Correction for World Action Models
world-model
VLA
manipulation
Aug 20, 2026
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
imitation-learning
VLA
manipulation
Aug 20, 2026
RhinoVLA Technical Report
VLA
cross-embodiment
flow-matching
manipulation
Aug 20, 2026
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
world-model
video-understanding
manipulation
Aug 20, 2026
M²-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills
VLA
world-model
manipulation
embodied-AI
Aug 20, 2026
Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
VLA
manipulation
diffusion-policy
Aug 20, 2026
Do as I Do: Dexterous Manipulation Data from Everyday Human Videos
imitation-learning
manipulation
3D-representation
Aug 20, 2026
Rethinking Intermediate Representation for VLM-based Robot Manipulation
manipulation
VLM
embodied-reasoning
Aug 20, 2026
KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis
embodied-reasoning
manipulation
VLM
Aug 20, 2026
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
world-model
manipulation
VLA
Aug 20, 2026
FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
world-model
manipulation
VLA
Aug 20, 2026
Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models
VLA
task-planning
manipulation
Aug 20, 2026
Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
VLA
world-model
manipulation
Aug 20, 2026
GEN-1: Scaling Embodied Foundation Models to Mastery
VLA
manipulation
imitation-learning
Aug 20, 2026
EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
VLA
manipulation
imitation-learning
Aug 20, 2026
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models
VLA
manipulation
Aug 20, 2026
DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation
manipulation
world-model
VLA
Aug 20, 2026
BiPreManip: Learning Affordance-Based Bimanual Preparatory Manipulation through Anticipatory Collaboration
manipulation
spatial-reasoning
imitation-learning
Aug 20, 2026
BadWAM: When World-Action Models Dream Right but Act Wrong
world-model
manipulation
Aug 20, 2026
PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation
VLA
world-model
manipulation
Aug 20, 2026
Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
VLA
imitation-learning
manipulation
Aug 20, 2026
PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding
VLA
manipulation
spatial-reasoning
Aug 20, 2026
Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence
manipulation
imitation-learning
spatial-reasoning
Aug 20, 2026
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
VLA
manipulation
3D-representation
Aug 20, 2026
World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
VLA
world-model
embodied-reasoning
manipulation
Aug 20, 2026
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
VLA
manipulation
Aug 20, 2026
MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent
VLA
manipulation
cross-embodiment
Aug 20, 2026
WALL-WM: Carving World Action Modeling at the Event Joints
world-model
VLA
manipulation
embodied-reasoning
Aug 20, 2026
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
VLA
manipulation
embodied-reasoning
Aug 20, 2026
MangoBench: A Benchmark for Multi-Agent Goal-Conditioned Offline Reinforcement Learning
RL
manipulation
navigation
Aug 20, 2026
BiCoord: A Bimanual Manipulation Benchmark towards Long-Horizon Spatial-Temporal Coordination
manipulation
VLA
diffusion-policy
Aug 20, 2026
Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation
VLA
world-model
manipulation
Aug 20, 2026
AGiLe: Learning Robust Long-Horizon Manipulation via Affordance-Grounded Bidirectional Latent Planning
manipulation
task-planning
spatial-reasoning
Aug 20, 2026
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation
manipulation
scene-understanding
spatial-reasoning
VLA
Aug 20, 2026
3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training
VLA
spatial-reasoning
manipulation
3D-representation
Aug 20, 2026
Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning
RL
manipulation
Aug 20, 2026
A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model
VLA
flow-matching
manipulation
Aug 20, 2026
VIRAL: Visual Sim-to-Real at Scale for Humanoid Loco-Manipulation
mobile-manipulation
legged
manipulation
Aug 20, 2026
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
VLA
manipulation
task-planning
Aug 20, 2026
TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies
VLA
manipulation
imitation-learning
Aug 20, 2026
TRM-VLA: Temporal-Aware Chain-of-Thought Reasoning and Memorization for Vision-Language-Action Models
VLA
embodied-reasoning
manipulation
Aug 20, 2026
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
VLA
world-model
manipulation
Aug 20, 2026
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
VLA
manipulation
Aug 20, 2026
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
VLA
imitation-learning
manipulation
Aug 20, 2026
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
VLA
manipulation
Aug 20, 2026
GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
VLA
manipulation
3D-representation
Aug 20, 2026
GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models
VLA
manipulation
spatial-reasoning
Aug 20, 2026
OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation
world-model
manipulation
VLA
Aug 20, 2026
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
VLA
manipulation
diffusion-policy
Aug 20, 2026
MolmoAct2: Action Reasoning Models for Real-world Deployment
VLA
embodied-reasoning
manipulation
Aug 20, 2026
GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors
imitation-learning
manipulation
VLA
3D-representation
Aug 20, 2026
From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
VLA
manipulation
embodied-reasoning
Aug 20, 2026
Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution
VLA
manipulation
flow-matching
Aug 20, 2026
Pure Vision-Language-Action (VLA) Models: A Comprehensive Survey
VLA
manipulation
embodied-reasoning
Aug 20, 2026
Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation
VLA
embodied-reasoning
manipulation
Aug 20, 2026
ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation
VLA
3D-representation
spatial-reasoning
manipulation
Aug 20, 2026
RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation
VLA
manipulation
embodied-reasoning
Aug 20, 2026
GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning
VLA
world-model
manipulation
Aug 20, 2026
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
embodied-reasoning
VLA
agentic-RL
manipulation
spatial-reasoning
Aug 20, 2026
World Action Models are Zero-shot Policies
world-model
VLA
manipulation
cross-embodiment
Aug 20, 2026
DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI
VLA
manipulation
navigation
mobile-manipulation
1/2/3
Aug 20, 2026
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Empirical Evidence on Conversational Control of GUI in Semantic Automation
manipulation
scene-understanding
Aug 20, 2026
CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding
VLA
manipulation
embodied-reasoning
LLM-subtasks
gripper-state-segments
Aug 20, 2026
OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics
mobile-manipulation
scene-understanding
manipulation
1-2
Aug 20, 2026
Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation
mobile-manipulation
imitation-learning
manipulation
Aug 20, 2026
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
world-model
video-understanding
manipulation
Samples
Aug 20, 2026
Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic Manipulation
manipulation
diffusion-policy
imitation-learning
Aug 20, 2026
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
VLA
flow-matching
manipulation
Aug 20, 2026
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
VLA
manipulation
instruction-following
Aug 20, 2026
Augmenting the action space with conventions to improve multi-agent cooperation in Hanabi
manipulation
RL
task-planning
Aug 20, 2026
ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping
manipulation
3D-representation
world-model
Aug 20, 2026
GarmentPile: Point-Level Visual Affordance Guided Retrieval and Adaptation for Cluttered Garments Manipulation
manipulation
scene-understanding
spatial-reasoning
Aug 20, 2026
What Matters in Building Vision-Language-Action Models for Generalist Robots
VLA
manipulation
cross-embodiment
Aug 20, 2026
Mind to Hand: Purposeful Robotic Control via Embodied Reasoning
VLA
embodied-reasoning
manipulation
Aug 20, 2026
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
VLA
embodied-reasoning
manipulation
Aug 20, 2026
Learning Foresightful Dense Visual Affordance for Deformable Object Manipulation
manipulation
scene-understanding
Aug 20, 2026
AffordDP: Generalizable Diffusion Policy with Transferable Affordance
diffusion-policy
manipulation
spatial-reasoning
Aug 20, 2026
DreamGen: Unlocking Generalization in Robot Learning through Video World Models
world-model
VLA
manipulation
Aug 20, 2026
VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models
manipulation
task-planning
scene-understanding
Aug 20, 2026
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
VLA
manipulation
embodied-reasoning
Aug 20, 2026
Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets
world-model
diffusion-policy
manipulation
imitation-learning
Aug 20, 2026
π*₀.₆: a VLA That Learns From Experience
VLA
RL
manipulation
flow-matching
Aug 20, 2026
HomeRobot: Open-Vocabulary Mobile Manipulation
mobile-manipulation
navigation
manipulation
scene-understanding
Aug 20, 2026
π0.5: a Vision-Language-Action Model with Open-World Generalization
VLA
manipulation
mobile-manipulation
cross-embodiment
Aug 20, 2026
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
diffusion-policy
imitation-learning
manipulation
Aug 20, 2026
GEN-0: Embodied Foundation Models That Scale with Physical Interaction
VLA
cross-embodiment
manipulation
Aug 20, 2026
RT-1: Robotics Transformer for Real-World Control at Scale
VLA
manipulation
imitation-learning
Aug 20, 2026
MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation
mobile-manipulation
VLA
manipulation
Aug 20, 2026
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
VLA
diffusion-policy
manipulation
Aug 20, 2026
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
VLA
diffusion-policy
manipulation
Aug 20, 2026
Gemini Robotics: Bringing AI into the Physical World
VLA
manipulation
embodied-reasoning
Aug 20, 2026
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
VLA
manipulation
imitation-learning
Aug 20, 2026
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
VLA
manipulation
cross-embodiment
Aug 20, 2026
Robotic Control via Embodied Chain-of-Thought Reasoning
VLA
embodied-reasoning
manipulation
Aug 20, 2026
RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
embodied-reasoning
manipulation
task-planning
Aug 20, 2026
RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping
manipulation
embodied-reasoning
scene-understanding
Aug 20, 2026
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
VLA
imitation-learning
manipulation
Aug 20, 2026
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
VLA
manipulation
embodied-reasoning
Aug 20, 2026
OpenVLA: An Open-Source Vision-Language-Action Model
VLA
manipulation
cross-embodiment
Aug 20, 2026
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
VLA
instruction-following
task-planning
manipulation
embodied-reasoning
Aug 20, 2026
Learning Precise Affordances from Egocentric Videos for Robotic Manipulation
manipulation
scene-understanding
spatial-reasoning
Aug 20, 2026
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation
VLA
manipulation
task-planning
Aug 20, 2026
IRASim: A Fine-Grained World Model for Robot Manipulation
world-model
manipulation
diffusion-policy
Aug 20, 2026
Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic Manipulation
diffusion-policy
manipulation
task-planning
Aug 20, 2026
FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation
VLA
manipulation
Aug 20, 2026
A Survey on Vision-Language-Action Models for Embodied AI
VLA
task-planning
manipulation
Aug 20, 2026
Octo: An Open-Source Generalist Robot Policy
VLA
diffusion-policy
cross-embodiment
manipulation
Aug 20, 2026
A Survey on Efficient Vision-Language-Action Models
VLA
manipulation
Aug 20, 2026
Cosmos World Foundation Model Platform for Physical AI
world-model
VLA
manipulation
Aug 20, 2026
A0: An Affordance-Aware Hierarchical Model for General Robotic Manipulation
manipulation
spatial-reasoning
VLA