DeepRead
Search
Search
Dark mode
Light mode
Explorer
Popular Tags
#VLM
#agentic-RL
#gui-agent
#web-agent
#LLM
#VLA
#computer-use
#task-planning
#manipulation
#imitation-learning
Tag: navigation
78 items with this tag.
Aug 20, 2026
Vision-Language Navigation Survey
VLN
navigation
embodied-reasoning
Aug 20, 2026
Embodied AI Survey
survey
VLA
manipulation
navigation
embodied-ai
robotics
embodied-reasoning
mobile-manipulation
Aug 20, 2026
Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual–Inertial Odometry
SLAM
navigation
RL
Aug 20, 2026
Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation
navigation
spatial-reasoning
scene-understanding
Aug 20, 2026
CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
navigation
VLN
VLM
Aug 20, 2026
AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation
agentic-RL
navigation
VLM
Aug 20, 2026
ABot-N1: Toward a General Visual Language Navigation Foundation Model
VLN
navigation
embodied-reasoning
Aug 20, 2026
WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation
VLA
world-model
navigation
UAV
Aug 20, 2026
WRIVINDER: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery
spatial-reasoning
3D-representation
navigation
Aug 20, 2026
MangoBench: A Benchmark for Multi-Agent Goal-Conditioned Offline Reinforcement Learning
RL
manipulation
navigation
Aug 20, 2026
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
spatial-reasoning
VLM
navigation
Aug 20, 2026
NavFoM: Embodied Navigation Foundation Model
VLN
navigation
cross-embodiment
VLM
Aug 20, 2026
One Agent to Guide Them All: Empowering MLLMs for Vision-and-Language Navigation via Explicit World Representation
VLN
navigation
embodied-reasoning
Aug 20, 2026
DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI
VLA
manipulation
navigation
mobile-manipulation
1/2/3
Aug 20, 2026
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
VLN
cross-embodiment
navigation
Aug 20, 2026
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
VLN
video-LLM
VLA
navigation
Aug 20, 2026
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
VLN
VLM
navigation
Aug 20, 2026
UI-Venus Technical Report: Building High-performance UI Agents with RFT
VLM
navigation
RL
Aug 20, 2026
Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation
navigation
scene-understanding
spatial-memory
Aug 20, 2026
UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
navigation
imitation-learning
RL
Aug 20, 2026
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
VLM
navigation
scene-understanding
Aug 20, 2026
SpiritSight Agent: Advanced GUI Agent with One Look
VLM
navigation
imitation-learning
Aug 20, 2026
AirNav: A Large-Scale Real-World UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions
VLN
agentic-RL
navigation
Aug 20, 2026
PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents
navigation
imitation-learning
task-planning
Aug 20, 2026
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
VLM
navigation
imitation-learning
Aug 20, 2026
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
navigation
imitation-learning
scene-understanding
Aug 20, 2026
MobileUse: A GUI Agent with Hierarchical Reflection for Autonomous Mobile Operation
navigation
imitation-learning
scene-understanding
Aug 20, 2026
UI Remix: Supporting UI Design Through Interactive Example Retrieval and Remixing
navigation
Aug 20, 2026
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
navigation
RL
web-agent
Aug 20, 2026
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
MAESTRO: Adapting GUIs and Guiding Navigation with User Preferences in Conversational Agents with GUIs
navigation
Aug 20, 2026
LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation
VLA
navigation
imitation-learning
Aug 20, 2026
Less is More: Empowering GUI Agent with Context-Aware Simplification
navigation
imitation-learning
web-agent
Aug 20, 2026
From Model-Based Screening to Data-Driven Surrogates: A Multi-Stage Workflow for Exploring Stochastic Agent-Based Models
navigation
Aug 20, 2026
GUIrilla: A Scalable Framework for Automated Desktop UI Exploration
VLM
navigation
scene-understanding
Aug 20, 2026
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
navigation
imitation-learning
task-planning
Aug 20, 2026
GUI-ReWalk: Massive Data Generation for GUI Agent via Stochastic Exploration and Intent-Aware Reasoning
navigation
imitation-learning
task-planning
Aug 20, 2026
BEAP-Agent: Backtrackable Execution and Adaptive Planning for GUI Agents
navigation
task-planning
web-agent
Aug 20, 2026
Large Language Model-Brained GUI Agents: A Survey
VLM
navigation
imitation-learning
Aug 20, 2026
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
navigation
scene-understanding
web-agent
Aug 20, 2026
GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
VLM
navigation
imitation-learning
Aug 20, 2026
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
navigation
imitation-learning
web-agent
Aug 20, 2026
GUICourse: From General Vision Language Models to Versatile GUI Agents
VLM
navigation
imitation-learning
Aug 20, 2026
Ferret-UI Lite: Lessons from Building Small On-Device GUI Agents
navigation
RL
scene-understanding
Aug 20, 2026
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
VLN
navigation
embodied-reasoning
Aug 20, 2026
Electrooculography Dataset for Objective Spatial Navigation Assessment in Healthy Participants
navigation
Aug 20, 2026
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
VLM
navigation
imitation-learning
Aug 20, 2026
Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation
navigation
imitation-learning
web-agent
Aug 20, 2026
AUTO-Explorer: Automated Data Collection for GUI Agent
navigation
imitation-learning
scene-understanding
Aug 20, 2026
Agent+P: Guiding UI Agents via Symbolic Planning
VLM
navigation
imitation-learning
Aug 20, 2026
Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence
web-agent
navigation
task-planning
Aug 20, 2026
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
VLN
VLA
navigation
legged
Aug 20, 2026
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
VLN
navigation
task-planning
1/2
Aug 20, 2026
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
VLN
navigation
video-LLM
Train
Samples
Trajectories
Token
Infer
Aug 20, 2026
ETP-R1: Evolving Topological Planning with Reinforcement Fine-tuning for Vision-Language Navigation in Continuous Environments
VLN
navigation
agentic-RL
Aug 20, 2026
HomeRobot: Open-Vocabulary Mobile Manipulation
mobile-manipulation
navigation
manipulation
scene-understanding
Aug 20, 2026
The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use
navigation
imitation-learning
web-agent
Aug 20, 2026
NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models
VLN
LLM
navigation
Aug 20, 2026
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
VLN
navigation
spatial-memory
Aug 20, 2026
Automation and AI Technology in Surface Mining With a Brief Introduction to Open-Pit Operations in the Pilbara
navigation
Aug 20, 2026
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
VLN
navigation
instruction-following
Aug 20, 2026
A Survey on (M)LLM-Based GUI Agents
VLA
navigation
imitation-learning
Aug 20, 2026
Visual Language Maps for Robot Navigation
semantic-map
navigation
scene-understanding
Aug 20, 2026
WalkVLM: Aid Visually Impaired People Walking by Vision Language Model
VLM
navigation
embodied-reasoning
Aug 20, 2026
Think Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation
VLN
navigation
spatial-memory
Aug 20, 2026
Rich Screen Reader Experiences for Accessible Data Visualization
navigation
imitation-learning
scene-understanding
Aug 20, 2026
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
VLN
navigation
VLM
Aug 20, 2026
Inventions on GUI Aesthetics
navigation
Aug 20, 2026
VL-Nav: A Neuro-Symbolic Approach for Reasoning-based Vision-Language Navigation
VLN
navigation
task-planning
Aug 20, 2026
Versatile Navigation under Partial Observability via Value-guided Diffusion Policy
navigation
diffusion-policy
Aug 20, 2026
NaviTrace: Evaluating Embodied Navigation of Vision-Language Models
navigation
VLM
embodied-reasoning
Aug 20, 2026
MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation
mobile-manipulation
navigation
scene-understanding
Aug 20, 2026
An Interactive Navigation Method with Effect-oriented Affordance
navigation
spatial-reasoning
semantic-map
Aug 20, 2026
EmbodiedSplat: Personalized Real-to-Sim-to-Real Navigation with Gaussian Splats from a Mobile Device
navigation
3D-representation
Aug 20, 2026
UItron: Foundational GUI Agent with Advanced Perception and Planning
VLM
navigation
imitation-learning
Aug 20, 2026
VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View
navigation
Aug 20, 2026
UISim: An Interactive Image-Based UI Simulator for Dynamic Mobile Environments
navigation
task-planning