DeepRead
Search
Search
Dark mode
Light mode
Explorer
Popular Tags
#VLM
#agentic-RL
#gui-agent
#web-agent
#LLM
#VLA
#computer-use
#task-planning
#manipulation
#imitation-learning
Tag: VLM
281 items with this tag.
Aug 20, 2026
VLM Survey
survey
VLM
multimodal
vision-language-model
visual-reasoning
Aug 20, 2026
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
VLM
multimodal-understanding
Aug 20, 2026
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
VLA
VLM
manipulation
Aug 20, 2026
Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation
VLM
gui-agent
Aug 20, 2026
WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
world-model
spatial-reasoning
VLM
Aug 20, 2026
MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models
gui-agent
VLM
Aug 20, 2026
When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents
spatial-memory
VLM
Aug 20, 2026
GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs
gui-agent
VLM
computer-use
Aug 20, 2026
World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
VLM
world-model
spatial-reasoning
Aug 20, 2026
Visual Access Boundaries in Vision-Language Model Reasoning
VLM
Aug 20, 2026
Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling
world-model
VLM
agentic-RL
Aug 20, 2026
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
video-understanding
video-LLM
VLM
Aug 20, 2026
SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
VLM
Aug 20, 2026
SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments
spatial-reasoning
agentic-RL
VLM
Aug 20, 2026
2604-SnapGuard
PromptInjection
WebAgent
Security
ScreenshotBased
VLM
Detection
Lightweight
Aug 20, 2026
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
VLM
RL
Aug 20, 2026
Mental World Modeling
world-model
LLM
VLM
Aug 20, 2026
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
VLM
agentic-RL
web-agent
Aug 20, 2026
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
video-LLM
video-understanding
VLM
Aug 20, 2026
Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
LLM
gui-agent
VLM
Aug 20, 2026
SketchVLM: Vision language models can annotate images to explain thoughts and guide users
VLM
visual-reasoning
explainability
Aug 20, 2026
See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles
gui-agent
computer-use
VLM
Aug 20, 2026
See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
VLM
Aug 20, 2026
Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
video-understanding
VLM
video-LLM
Aug 20, 2026
Scaling Spatial Intelligence with Multimodal Foundation Models
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
spatial-reasoning
VLM
scene-understanding
Aug 20, 2026
Kimi K3: Open Frontier Intelligence
LLM
agentic-RL
VLM
Aug 20, 2026
SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
video-LLM
video-understanding
VLM
Aug 20, 2026
S2-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
spatial-reasoning
VLM
scene-understanding
Aug 20, 2026
Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning
agentic-RL
VLM
Aug 20, 2026
OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Dynamics-Aware Preference Optimization for Vision-Language Models
VLM
RL
Aug 20, 2026
DualMirage: Hunting Stealthy Multimodal LLM Agents via CAPTCHAs with Contour and Adversarial Illusions
web-agent
VLM
gui-agent
Aug 20, 2026
RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
agentic-RL
VLM
instruction-following
Aug 20, 2026
MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
VLM
Aug 20, 2026
Rethinking Token Reduction for Large Vision-Language Models
VLM
Aug 20, 2026
Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning
VLM
spatial-reasoning
Aug 20, 2026
Rethinking Intermediate Representation for VLM-based Robot Manipulation
manipulation
VLM
embodied-reasoning
Aug 20, 2026
DataComp-VLM: Improved Open Datasets for Vision-Language Models
VLM
Aug 20, 2026
RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
computer-use
task-planning
VLM
Aug 20, 2026
KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis
embodied-reasoning
manipulation
VLM
Aug 20, 2026
DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
gui-agent
VLM
Aug 20, 2026
Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
VLM
Aug 20, 2026
Gemma 4 Technical Report
VLM
LLM
Aug 20, 2026
Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure
gui-agent
computer-use
VLM
Aug 20, 2026
HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
world-model
3D-representation
VLM
Aug 20, 2026
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
VLM
spatial-reasoning
VLA
Aug 20, 2026
GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction
gui-agent
VLM
Aug 20, 2026
ReFAct: Empowering Multimodal Web Agents with Visual and Context Focusing
web-agent
VLM
agentic-RL
Aug 20, 2026
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning
VLM
agentic-RL
Aug 20, 2026
FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification
VLM
agentic-RL
Aug 20, 2026
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
video-LLM
video-understanding
VLM
Aug 20, 2026
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
VLM
scene-understanding
Aug 20, 2026
CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
navigation
VLN
VLM
Aug 20, 2026
EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
gui-agent
VLM
Aug 20, 2026
Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Models
VLM
Aug 20, 2026
CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning
gui-agent
agentic-RL
VLM
Aug 20, 2026
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
VLM
Aug 20, 2026
Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM
VLM
LLM
Aug 20, 2026
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
video-LLM
video-understanding
VLM
Aug 20, 2026
Beyond Sequential Tools: A Unified VLM Agent System for Photographic Post-Processing via Dynamic Multi-Expert Fusion
VLM
task-planning
instruction-following
Aug 20, 2026
BAMI: Training-Free Bias Mitigation in GUI Grounding
gui-agent
computer-use
VLM
Aug 20, 2026
Beacon: Knowing When and How to Perform Agentic Visual Reasoning
VLM
agentic-RL
Aug 20, 2026
Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models
spatial-reasoning
VLM
agentic-RL
Aug 20, 2026
Benchmarking and Improving GUI Agents in High-Dynamic Environments
GUI-Agent
Benchmark
POMDP
Dynamic-Environment
VLM
Aug 20, 2026
Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators
spatial-reasoning
world-model
agentic-RL
VLM
Aug 20, 2026
Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
agentic-RL
VLM
spatial-reasoning
Aug 20, 2026
PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning
spatial-reasoning
VLM
RL
Aug 20, 2026
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
VLM
LLM
embodied-reasoning
Aug 20, 2026
Agentic Video Summarization via Self-Reflecting Multimodal Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
Agentic Retoucher for Text-To-Image Generation
VLM
task-planning
agentic-RL
Aug 20, 2026
Orca: The World is in Your Mind
world-model
VLM
VLA
Aug 20, 2026
AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation
agentic-RL
navigation
VLM
Aug 20, 2026
OctoT2I: A Self-Evolving Agentic Text-to-Image Router
task-planning
VLM
LLM
Aug 20, 2026
AgentDet: A Shared-Blackboard Multi-Agent Framework for Zero-/Few-Shot Object Detection
VLM
scene-understanding
LLM
Aug 20, 2026
Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection
VLM
LLM
Aug 20, 2026
OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models
gui-agent
computer-use
VLM
Aug 20, 2026
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
µVLM: A Vision Language Model for µNPUs
VLM
Aug 20, 2026
iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception
gui-agent
computer-use
VLM
Aug 20, 2026
AdapAction: Adaptive Target Action Backdoor Attack against GUI Agents
gui-agent
computer-use
VLM
Aug 20, 2026
MonoVLM: Monocular 3D Visual Grounding with Vision Language Models
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
VLM
video-LLM
video-understanding
Aug 20, 2026
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
VLM
instruction-following
Aug 20, 2026
Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models
VLA
embodied-reasoning
VLM
Aug 20, 2026
MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis
world-model
LLM
VLM
Aug 20, 2026
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?
VLM
spatial-reasoning
Aug 20, 2026
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
VLM
task-planning
agentic-RL
Aug 20, 2026
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
agentic-RL
VLM
Aug 20, 2026
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
VLM
spatial-reasoning
Aug 20, 2026
MVP: Multiple View Prediction Improves GUI Grounding
gui-agent
VLM
computer-use
Aug 20, 2026
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
video-LLM
video-understanding
VLM
Aug 20, 2026
VisPlay: Self-Evolving Vision-Language Models
agentic-RL
VLM
Aug 20, 2026
AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark
gui-agent
VLM
Aug 20, 2026
Vinedresser3D: Towards Agentic Text-guided 3D Editing
3D-representation
VLM
task-planning
Aug 20, 2026
ViLoMem: Agentic Learner with Grow-and-Refine Multimodal Semantic Memory
VLM
LLM
Aug 20, 2026
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
VLM
task-planning
spatial-reasoning
Aug 20, 2026
VLM-PTQ: Efficient Post-Training Quantization for Large Vision-Language Models
VLM
Aug 20, 2026
When Vision Speaks for Sound
VLM
video-LLM
agentic-RL
Aug 20, 2026
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
spatial-reasoning
VLM
Aug 20, 2026
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
video-LLM
agentic-RL
VLM
Aug 20, 2026
Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration
web-agent
gui-agent
VLM
Aug 20, 2026
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
gui-agent
VLM
imitation-learning
Aug 20, 2026
VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery
VLM
3D-representation
embodied-reasoning
Aug 20, 2026
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
video-LLM
VLM
Aug 20, 2026
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
spatial-reasoning
VLM
video-understanding
Aug 20, 2026
VLM4RSDet: Collaborative Optimization with Vision-Language Model for Enhancing Remote Sensing Object Detection
VLM
scene-understanding
Aug 20, 2026
TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs
VLM
LLM
Aug 20, 2026
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
VLM
3D-representation
spatial-reasoning
Aug 20, 2026
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
agentic-RL
VLM
Aug 20, 2026
SecAgent: Efficient Mobile GUI Agent with Semantic Context
gui-agent
computer-use
VLM
Aug 20, 2026
Unlimited OCR Works
VLM
LLM
Aug 20, 2026
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
gui-agent
VLM
Aug 20, 2026
Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent
VLM
LLM
instruction-following
Aug 20, 2026
Jailbreaking Vision-Language Models via Dissonance-Guided Suffix Optimization and Image-Phrase Injection
VLM
Aug 20, 2026
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
VLM
scene-understanding
embodied-reasoning
Aug 20, 2026
UZ3DVG: Unaided Zero-Shot 3D Visual Grounding with Generated Language Conditions
spatial-reasoning
scene-understanding
VLM
Aug 20, 2026
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
spatial-reasoning
VLM
navigation
Aug 20, 2026
InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
spatial-reasoning
VLM
scene-understanding
OB
CN
OB/CN
Aug 20, 2026
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
gui-agent
VLM
Aug 20, 2026
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
VLM
world-model
Aug 20, 2026
IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding
VLM
gui-agent
Aug 20, 2026
From Where Things Are to What They Are For: Benchmarking Spatial–Functional Intelligence in Multimodal LLMs
spatial-reasoning
VLM
video-understanding
Aug 20, 2026
PersonaVLM: Long-Term Personalized Multimodal LLMs
VLM
agentic-RL
LLM
Aug 20, 2026
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search
video-LLM
video-understanding
VLM
Aug 20, 2026
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
HiconAgent: History Context-aware Policy Optimization for GUI Agents
gui-agent
agentic-RL
VLM
Aug 20, 2026
Think, Then Verify: A Hypothesis–Verification Multi-Agent Framework for Long Video Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
A History-Aware Visually Grounded Critic for Computer Use Agents
gui-agent
computer-use
VLM
Aug 20, 2026
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Tackling Model Bias via Game-theoretic Multi-agent Collaboration Framework for Hateful Meme Classification
VLM
LLM
Aug 20, 2026
Hear you are: Teaching LLMs Spatial Reasoning with Vision and Spatial Sound
spatial-reasoning
VLM
scene-understanding
Aug 20, 2026
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
gui-agent
VLM
computer-use
Aug 20, 2026
SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks
spatial-reasoning
gui-agent
VLM
Aug 20, 2026
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Hybrid Self-evolving Structured Memory for GUI Agents
VLM
task-planning
web-agent
Aug 20, 2026
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
gui-agent
computer-use
VLM
Aug 20, 2026
SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Grounded 3D-Aware Spatial Vision-Language Modeling
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
VLM
LLM
Aug 20, 2026
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
VLM
agentic-RL
Aug 20, 2026
Socratic-Geo: Synthetic Data Generation and Cross-Modal Geometric Reasoning via Multi-Agent Interaction
VLM
spatial-reasoning
agentic-RL
Aug 20, 2026
SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Geometrically-Constrained Agent for Spatial Reasoning
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
web-agent
agentic-RL
VLM
Aug 20, 2026
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
gui-agent
video-LLM
VLM
Aug 20, 2026
SenseSearch: Empowering Vision-Language Models with High-Resolution Agentic Search-Reasoning via Reinforcement Learning
VLM
agentic-RL
web-agent
Aug 20, 2026
Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis
VLM
Aug 20, 2026
GUI-SAGE: Enhancing GUI Automation with Self-Explanatory Learning
gui-agent
agentic-RL
VLM
Aug 20, 2026
How Mobile World Model Guides GUI Agents?
gui-agent
world-model
VLM
Aug 20, 2026
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
gui-agent
computer-use
VLM
Aug 20, 2026
GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training
agentic-RL
VLM
embodied-reasoning
Aug 20, 2026
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
gui-agent
agentic-RL
VLM
Aug 20, 2026
G2 VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
spatial-reasoning
3D-representation
VLM
Aug 20, 2026
From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
MMSkills: Towards Multimodal Skills for General Visual Agents
gui-agent
task-planning
VLM
Aug 20, 2026
First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models
VLM
scene-understanding
Aug 20, 2026
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
VLM
video-understanding
Aug 20, 2026
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients
VLM
LLM
Aug 20, 2026
LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
world-model
VLM
Aug 20, 2026
ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data
computer-use
gui-agent
VLM
Aug 20, 2026
Evaluating and Easing Hallucinations for GUI Grounding
gui-agent
VLM
computer-use
Aug 20, 2026
Exploring Spatial Intelligence from a Generative Perspective
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Robix: A Unified Model for Robot Interaction, Reasoning and Planning
embodied-reasoning
task-planning
VLM
Aug 20, 2026
IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools
VLM
agentic-RL
Aug 20, 2026
Experience Transfer for Multimodal LLM Agents in Minecraft Game
embodied-reasoning
task-planning
VLM
Aug 20, 2026
EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval
agentic-RL
VLM
web-agent
Aug 20, 2026
What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity
VLM
agentic-RL
gui-agent
Aug 20, 2026
Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching
spatial-reasoning
VLM
Aug 20, 2026
NavFoM: Embodied Navigation Foundation Model
VLN
navigation
cross-embodiment
VLM
Aug 20, 2026
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
web-agent
video-understanding
VLM
Aug 20, 2026
Rethinking Cross-Layer Information Routing in Diffusion Transformers
VLM
world-model
Aug 20, 2026
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
embodied-reasoning
VLM
spatial-reasoning
Aug 20, 2026
EG-3DVG: Expression and Geometry Aware Grounding Decoder for 3D Visual Grounding
scene-understanding
spatial-reasoning
VLM
Aug 20, 2026
Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
LLM
gui-agent
VLM
Aug 20, 2026
ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents
gui-agent
computer-use
VLM
Aug 20, 2026
Process Rewards with Learned Reliability
agentic-RL
VLM
Aug 20, 2026
Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment
gui-agent
computer-use
VLM
Aug 20, 2026
OpenCUA: Open Foundations for Computer-Use Agents
computer-use
gui-agent
VLM
imitation-learning
Aug 20, 2026
Kimi K2.5: Visual Agentic Intelligence
VLM
agentic-RL
LLM
Aug 20, 2026
AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding
gui-agent
VLM
computer-use
Aug 20, 2026
ZonUI-3B: Competitive GUI Grounding with a 3B VLM Trained on a Single Consumer GPU
gui-agent
VLM
computer-use
Aug 20, 2026
VLMDiff: Leveraging Vision-Language Models for Multi-Class Anomaly Detection with Diffusion
VLM
scene-understanding
Aug 20, 2026
Thinker: A vision-language foundation model for embodied intelligence
VLM
embodied-reasoning
task-planning
Aug 20, 2026
Safe Vision-Language Models via Unsafe Weights Manipulation
VLM
Aug 20, 2026
OpenLVLM-MIA: A Controlled Benchmark Revealing the Limits of Membership Inference Attacks on Large Vision-Language Models
VLM
Aug 20, 2026
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
GUIGuard-Bench: Toward a General Evaluation for Privacy-Preserving GUI Agents
gui-agent
computer-use
VLM
Aug 20, 2026
FairVLM: Enhancing Fairness and Prompt Sensitivity in Vision Language Models for Medical Image Segmentation
VLM
Aug 20, 2026
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
VLN
VLM
navigation
Aug 20, 2026
RoboBrain 2.0 Technical Report
spatial-reasoning
VLM
task-planning
Samples
Tunable
Aug 20, 2026
UIPro: Unleashing Superior Interaction Capability For GUI Agents
VLM
imitation-learning
scene-understanding
Aug 20, 2026
UI-Venus Technical Report: Building High-performance UI Agents with RFT
VLM
navigation
RL
Aug 20, 2026
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
VLM
scene-understanding
Aug 20, 2026
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
VLM
navigation
scene-understanding
Aug 20, 2026
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
VLM
Aug 20, 2026
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
VLM
imitation-learning
RL
Aug 20, 2026
GPT-4V(ision) is a Generalist Web Agent, if Grounded
gui-agent
web-agent
VLM
Aug 20, 2026
Visual Agentic AI for Spatial Reasoning with a Dynamic API
spatial-reasoning
VLM
embodied-reasoning
Aug 20, 2026
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
SpiritSight Agent: Advanced GUI Agent with One Look
VLM
navigation
imitation-learning
Aug 20, 2026
Retrieval-augmented GUI Agents with Generative Guidelines
VLM
imitation-learning
web-agent
Aug 20, 2026
AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent
gui-agent
VLM
computer-use
Aug 20, 2026
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
VLM
navigation
imitation-learning
Aug 20, 2026
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
VLM
imitation-learning
web-agent
Aug 20, 2026
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
VLM
task-planning
instruction-following
Aug 20, 2026
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
VLM
scene-understanding
spatial-reasoning
Aug 20, 2026
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
VLM
imitation-learning
task-planning
Aug 20, 2026
MEGA-GUI: Multi-stage Enhanced Grounding Agents for GUI Elements
VLM
scene-understanding
Aug 20, 2026
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
VLM
scene-understanding
3D-representation
Aug 20, 2026
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
VLM
imitation-learning
RL
Aug 20, 2026
LLM-Powered GUI Agents in Phone Automation: Surveying Progress and Prospects
VLM
imitation-learning
RL
Aug 20, 2026
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
VLM
imitation-learning
scene-understanding
Aug 20, 2026
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
VLM
imitation-learning
RL
Aug 20, 2026
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
VLM
scene-understanding
web-agent
Aug 20, 2026
GUIrilla: A Scalable Framework for Automated Desktop UI Exploration
VLM
navigation
scene-understanding
Aug 20, 2026
MobileFlow: A Multimodal LLM For Mobile GUI Agent
VLM
VLA
scene-understanding
Aug 20, 2026
Large Language Model-Brained GUI Agents: A Survey
VLM
navigation
imitation-learning
Aug 20, 2026
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
VLM
imitation-learning
task-planning
Aug 20, 2026
Improved GUI Grounding via Iterative Narrowing
VLM
imitation-learning
RL
Aug 20, 2026
GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
VLM
navigation
imitation-learning
Aug 20, 2026
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
GUICourse: From General Vision Language Models to Versatile GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
Foundations of GenIR
VLM
imitation-learning
scene-understanding
Aug 20, 2026
Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
embodied-reasoning
agentic-RL
VLM
Aug 20, 2026
Evaluating Open-Source Vision-Language Models for Multimodal Sarcasm Detection
VLM
Aug 20, 2026
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
VLM
navigation
imitation-learning
Aug 20, 2026
Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
VLM
imitation-learning
web-agent
Aug 20, 2026
Auto-scaling Continuous Memory for GUI Agent
VLM
task-planning
web-agent
Aug 20, 2026
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
VLM
imitation-learning
RL
Aug 20, 2026
MP-GUI: Modality Perception with MLLMs for GUI Understanding
gui-agent
VLM
computer-use
Aug 20, 2026
Agent-Initiated Interaction in Phone UI Automation
VLM
scene-understanding
Aug 20, 2026
Agent+P: Guiding UI Agents via Symbolic Planning
VLM
navigation
imitation-learning
Aug 20, 2026
LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models
spatial-reasoning
VLM
3D-representation
Aug 20, 2026
Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment
VLM
imitation-learning
RL
Aug 20, 2026
GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks
VLM
agentic-RL
embodied-reasoning
Aug 20, 2026
FastVLM: Efficient Vision Encoding for Vision Language Models
VLM
Aug 20, 2026
CogAgent: A Visual Language Model for GUI Agents
gui-agent
VLM
computer-use
Aug 20, 2026
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
gui-agent
computer-use
VLM
Aug 20, 2026
Embodied Scene Understanding for Vision Language Models via MetaVQA
scene-understanding
spatial-reasoning
VLM
Aug 20, 2026
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
video-LLM
video-understanding
VLM
Aug 20, 2026
AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials
web-agent
gui-agent
VLM
Aug 20, 2026
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
VLM
computer-use
Aug 20, 2026
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
VLM
LLM
Aug 20, 2026
OS-ATLAS: A Foundation Action Model for Generalist GUI Agents
gui-agent
computer-use
VLM
Elements
Aug 20, 2026
MiMo-Embodied: X-Embodied Foundation Model Technical Report
VLM
embodied-reasoning
spatial-reasoning
Aug 20, 2026
PaLM-E: An Embodied Multimodal Language Model
VLM
embodied-reasoning
task-planning
Aug 20, 2026
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
gui-agent
VLM
computer-use
Aug 20, 2026
The Impact of Element Ordering on LM Agent Performance
gui-agent
web-agent
VLM
Aug 20, 2026
OmniParser for Pure Vision Based GUI Agent
gui-agent
computer-use
VLM
1/3
Aug 20, 2026
WalkVLM: Aid Visually Impaired People Walking by Vision Language Model
VLM
navigation
embodied-reasoning
Aug 20, 2026
Visual Test-time Scaling for GUI Agent Grounding
gui-agent
computer-use
VLM
Aug 20, 2026
VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
VLM
video-understanding
spatial-reasoning
Aug 20, 2026
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
VLN
navigation
VLM
Aug 20, 2026
Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning
embodied-reasoning
VLM
spatial-reasoning
Aug 20, 2026
UINavBench: A Framework for Comprehensive Evaluation of Interactive Digital Agents
gui-agent
computer-use
VLM
Aug 20, 2026
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
VLM
video-understanding
video-LLM
Aug 20, 2026
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
video-LLM
video-understanding
VLM
Aug 20, 2026
NaviTrace: Evaluating Embodied Navigation of Vision-Language Models
navigation
VLM
embodied-reasoning
Aug 20, 2026
MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
VLM
Aug 20, 2026
Investigating Compositional Challenges in Vision-Language Models for Visual Grounding
VLM
scene-understanding
Aug 20, 2026
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
video-LLM
video-understanding
VLM
Aug 20, 2026
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
gui-agent
VLM
computer-use
Aug 20, 2026
Dual-View Visual Contextualization for Web Navigation
web-agent
gui-agent
VLM
Aug 20, 2026
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
embodied-reasoning
VLM
task-planning
Env
Tasks
Aug 20, 2026
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
VLM
spatial-reasoning
scene-understanding
Aug 20, 2026
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
computer-use
gui-agent
VLM
Aug 20, 2026
Evidence-Dependent GUI Grounding
gui-agent
VLM
Aug 20, 2026
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
VLA
embodied-reasoning
VLM
Aug 20, 2026
CAPTURE: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
spatial-reasoning
VLM
Aug 20, 2026
Web-CogReasoner: Towards Knowledge-Induced Cognitive Reasoning for Web Agents
VLM
imitation-learning
scene-understanding
Aug 20, 2026
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
VLM
imitation-learning
Aug 20, 2026
UItron: Foundational GUI Agent with Advanced Perception and Planning
VLM
navigation
imitation-learning