DeepRead
Search
Search
Dark mode
Light mode
Explorer
Popular Tags
#VLM
#agentic-RL
#gui-agent
#web-agent
#LLM
#VLA
#computer-use
#task-planning
#manipulation
#imitation-learning
Tag: instruction-following
25 items with this tag.
Aug 20, 2026
Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models
VLA
instruction-following
manipulation
Aug 20, 2026
Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
mobile-manipulation
agentic-RL
instruction-following
Aug 20, 2026
Plover: Steering GUI Agents through Plan-Centric Interaction
gui-agent
task-planning
instruction-following
Aug 20, 2026
Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents
LLM
instruction-following
Aug 20, 2026
RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
agentic-RL
VLM
instruction-following
Aug 20, 2026
AI Agents Do Not Fail Alone: The Context Fails First
LLM
instruction-following
Aug 20, 2026
Beyond Sequential Tools: A Unified VLM Agent System for Photographic Post-Processing via Dynamic Multi-Expert Fusion
VLM
task-planning
instruction-following
Aug 20, 2026
Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation
LLM
instruction-following
Aug 20, 2026
PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
LLM
instruction-following
Aug 20, 2026
Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paper
auto-research
LLM
instruction-following
Aug 20, 2026
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
VLA
agentic-RL
instruction-following
Aug 20, 2026
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
VLM
instruction-following
Aug 20, 2026
Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent
VLM
LLM
instruction-following
Aug 20, 2026
InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
diffusion-policy
instruction-following
world-model
Aug 20, 2026
PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents
gui-agent
computer-use
instruction-following
Aug 20, 2026
AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild
gui-agent
instruction-following
Aug 20, 2026
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
gui-agent
instruction-following
hci
Aug 20, 2026
RT-H: Action Hierarchies Using Language
VLA
imitation-learning
instruction-following
Aug 20, 2026
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
VLM
task-planning
instruction-following
Aug 20, 2026
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
VLA
manipulation
instruction-following
Aug 20, 2026
MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
gui-agent
task-planning
instruction-following
Aug 20, 2026
TidyBot: Personalized Robot Assistance with Large Language Models
LLM
mobile-manipulation
scene-understanding
instruction-following
Aug 20, 2026
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
VLN
navigation
instruction-following
Aug 20, 2026
Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
task-planning
instruction-following
mobile-manipulation
1/3
Aug 20, 2026
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
VLA
instruction-following
task-planning
manipulation
embodied-reasoning