DeepRead
Search
Search
Dark mode
Light mode
Explorer
Popular Tags
#VLM
#agentic-RL
#gui-agent
#web-agent
#LLM
#VLA
#computer-use
#task-planning
#manipulation
#imitation-learning
Tag: spatial-reasoning
100 items with this tag.
Aug 20, 2026
WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
world-model
spatial-reasoning
VLM
Aug 20, 2026
World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
VLM
world-model
spatial-reasoning
Aug 20, 2026
SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments
spatial-reasoning
agentic-RL
VLM
Aug 20, 2026
Scaling Spatial Intelligence with Multimodal Foundation Models
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
spatial-reasoning
VLM
scene-understanding
Aug 20, 2026
S2-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
spatial-reasoning
VLM
scene-understanding
Aug 20, 2026
OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning
VLM
spatial-reasoning
Aug 20, 2026
DENALI: A Dataset Enabling Non-Line-of-Sight Spatial Reasoning with Low-Cost LiDARs
spatial-reasoning
scene-understanding
3D-representation
Aug 20, 2026
Curvature-Aware Captioning: Leveraging Geodesic Attention for 3D Scene Understanding
scene-understanding
spatial-reasoning
3D-representation
Aug 20, 2026
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
VLM
spatial-reasoning
VLA
Aug 20, 2026
Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation
navigation
spatial-reasoning
scene-understanding
Aug 20, 2026
Gemini Robotics ER 1.6: Enhanced Embodied Reasoning
embodied-reasoning
spatial-reasoning
scene-understanding
Aug 20, 2026
BiPreManip: Learning Affordance-Based Bimanual Preparatory Manipulation through Anticipatory Collaboration
manipulation
spatial-reasoning
imitation-learning
Aug 20, 2026
Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models
spatial-reasoning
VLM
agentic-RL
Aug 20, 2026
Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators
spatial-reasoning
world-model
agentic-RL
VLM
Aug 20, 2026
Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
agentic-RL
VLM
spatial-reasoning
Aug 20, 2026
PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning
spatial-reasoning
VLM
RL
Aug 20, 2026
PV-Ground: Text-Guided Point-Voxel Interaction for 3D Visual Grounding
scene-understanding
3D-representation
spatial-reasoning
Aug 20, 2026
PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding
VLA
manipulation
spatial-reasoning
Aug 20, 2026
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence
manipulation
imitation-learning
spatial-reasoning
Aug 20, 2026
MonoVLM: Monocular 3D Visual Grounding with Vision Language Models
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
WRIVINDER: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery
spatial-reasoning
3D-representation
navigation
Aug 20, 2026
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?
VLM
spatial-reasoning
Aug 20, 2026
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
spatial-reasoning
scene-understanding
LLM
Aug 20, 2026
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
VLM
spatial-reasoning
Aug 20, 2026
AGiLe: Learning Robust Long-Horizon Manipulation via Affordance-Grounded Bidirectional Latent Planning
manipulation
task-planning
spatial-reasoning
Aug 20, 2026
Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation
manipulation
scene-understanding
spatial-reasoning
VLA
Aug 20, 2026
3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training
VLA
spatial-reasoning
manipulation
3D-representation
Aug 20, 2026
Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulation
VLA
manipulation
spatial-reasoning
Aug 20, 2026
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
VLM
task-planning
spatial-reasoning
Aug 20, 2026
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
scene-understanding
spatial-reasoning
VLN
Aug 20, 2026
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
spatial-reasoning
VLM
Aug 20, 2026
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
spatial-reasoning
VLM
video-understanding
Aug 20, 2026
TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation
LLM
spatial-reasoning
Aug 20, 2026
Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images
3D-representation
spatial-reasoning
embodied-reasoning
Aug 20, 2026
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
VLM
3D-representation
spatial-reasoning
Aug 20, 2026
Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
UZ3DVG: Unaided Zero-Shot 3D Visual Grounding with Generated Language Conditions
spatial-reasoning
scene-understanding
VLM
Aug 20, 2026
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
spatial-reasoning
VLM
navigation
Aug 20, 2026
InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
spatial-reasoning
VLM
scene-understanding
OB
CN
OB/CN
Aug 20, 2026
Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds
scene-understanding
3D-representation
spatial-reasoning
Aug 20, 2026
From Where Things Are to What They Are For: Benchmarking Spatial–Functional Intelligence in Multimodal LLMs
spatial-reasoning
VLM
video-understanding
Aug 20, 2026
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic–Spatial Fusion and Latent Predictive Representation
VLN
VLA
world-model
spatial-reasoning
Ep
Aug 20, 2026
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Hear you are: Teaching LLMs Spatial Reasoning with Vision and Spatial Sound
spatial-reasoning
VLM
scene-understanding
Aug 20, 2026
SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks
spatial-reasoning
gui-agent
VLM
Aug 20, 2026
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Grounded 3D-Aware Spatial Vision-Language Modeling
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence
3D-representation
scene-understanding
spatial-reasoning
Aug 20, 2026
SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL
spatial-reasoning
agentic-RL
embodied-reasoning
Aug 20, 2026
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Socratic-Geo: Synthetic Data Generation and Cross-Modal Geometric Reasoning via Multi-Agent Interaction
VLM
spatial-reasoning
agentic-RL
Aug 20, 2026
SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Geometrically-Constrained Agent for Spatial Reasoning
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
DyGeoVLN: Infusing Dynamic Geometry Foundation Model into Vision-Language Navigation
VLN
3D-representation
spatial-reasoning
Aug 20, 2026
GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models
VLA
manipulation
spatial-reasoning
Aug 20, 2026
G2 VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
spatial-reasoning
3D-representation
VLM
Aug 20, 2026
From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments
VLA
cross-embodiment
spatial-reasoning
Aug 20, 2026
Exploring Spatial Intelligence from a Generative Perspective
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
OmniEVA: Embodied Versatile PlAnner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning
embodied-reasoning
spatial-reasoning
task-planning
Aug 20, 2026
Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching
spatial-reasoning
VLM
Aug 20, 2026
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
embodied-reasoning
VLM
spatial-reasoning
Aug 20, 2026
EG-3DVG: Expression and Geometry Aware Grounding Decoder for 3D Visual Grounding
scene-understanding
spatial-reasoning
VLM
Aug 20, 2026
ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation
VLA
3D-representation
spatial-reasoning
manipulation
Aug 20, 2026
RynnBrain: Open Embodied Foundation Models
VLA
spatial-reasoning
task-planning
Aug 20, 2026
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
embodied-reasoning
VLA
agentic-RL
manipulation
spatial-reasoning
Aug 20, 2026
RoboBrain 2.5: Depth in Sight, Time in Mind
spatial-reasoning
VLA
RL
Aug 20, 2026
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
RoboBrain 2.0 Technical Report
spatial-reasoning
VLM
task-planning
Samples
Tunable
Aug 20, 2026
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Visual Agentic AI for Spatial Reasoning with a Dynamic API
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
VLA
spatial-reasoning
embodied-reasoning
Aug 20, 2026
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
VLM
scene-understanding
spatial-reasoning
Aug 20, 2026
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
scene-understanding
3D-representation
spatial-reasoning
Aug 20, 2026
LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
GarmentPile: Point-Level Visual Affordance Guided Retrieval and Adaptation for Cluttered Garments Manipulation
manipulation
scene-understanding
spatial-reasoning
Aug 20, 2026
Embodied Scene Understanding for Vision Language Models via MetaVQA
scene-understanding
spatial-reasoning
VLM
Aug 20, 2026
An Embodied Generalist Agent in 3D World
VLA
scene-understanding
spatial-reasoning
data
Aug 20, 2026
AffordDP: Generalizable Diffusion Policy with Transferable Affordance
diffusion-policy
manipulation
spatial-reasoning
Aug 20, 2026
Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence
VLA
spatial-reasoning
agentic-RL
Aug 20, 2026
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
spatial-reasoning
embodied-reasoning
video-LLM
agentic-RL
Aug 20, 2026
MiMo-Embodied: X-Embodied Foundation Model Technical Report
VLM
embodied-reasoning
spatial-reasoning
Aug 20, 2026
VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
VLM
video-understanding
spatial-reasoning
Aug 20, 2026
Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning
embodied-reasoning
VLM
spatial-reasoning
Aug 20, 2026
Learning Precise Affordances from Egocentric Videos for Robotic Manipulation
manipulation
scene-understanding
spatial-reasoning
Aug 20, 2026
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
An Interactive Navigation Method with Effect-oriented Affordance
navigation
spatial-reasoning
semantic-map
Aug 20, 2026
CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance
VLA
embodied-reasoning
spatial-reasoning
Aug 20, 2026
CAPTURE: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
spatial-reasoning
VLM
Aug 20, 2026
A0: An Affordance-Aware Hierarchical Model for General Robotic Manipulation
manipulation
spatial-reasoning
VLA