Computer Vision and Pattern Recognition · Computer Science
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
Tianyuan Yuan, Yicheng Liu, Chenhao Lu, Zhuoguang Chen +2
2025-10-16
Computer Vision and Pattern Recognition · Computer Science
AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models
Zhifeng Rao, Wenlong Chen, Lei Xie, Xia Hua +3
2026-04-27
Robotics · Computer Science
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou +4
2025-11-25
Computer Vision and Pattern Recognition · Computer Science
Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu +13
2026-05-15
Computer Vision and Pattern Recognition · Computer Science
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
Jianke Zhang, Yanjiang Guo, Yucheng Hu, Xiaoyu Chen +2
2025-06-27
Robotics · Computer Science
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
Ruisen Tu, Arth Shukla, Sohyun Yoo, Xuanlin Li +4
2026-03-25
Computer Vision and Pattern Recognition · Computer Science
QuoVLA: Quotient Space for Vision-Language-Action Models
Xuan Wang, Yinan Wu, Haoran Duan, Jungong Han
2026-05-26
Robotics · Computer Science
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
Lin Sun, Bin Xie, Yingfei Liu, Hao Shi +2
2025-08-14
Robotics · Computer Science
TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
Zongzheng Zhang, Haobo Xu, Zhuo Yang, Chenghao Yue +4
2025-09-10
Robotics · Computer Science
3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks
Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri +1
2026-03-31
Computer Vision and Pattern Recognition · Computer Science
3D-VLA: A 3D Vision-Language-Action Generative World Model
Haoyu Zhen, Xiaowen Qiu, Peihao Chen, Jincheng Yang +4
2024-03-15
Robotics · Computer Science
Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
Weifan Guan, Qinghao Hu, Aosheng Li, Jian Cheng
2025-10-24
Robotics · Computer Science
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai +9
2026-05-12
Computer Vision and Pattern Recognition · Computer Science
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
Yulin Luo, Hao Chen, Zhuangzhe Wu, Bowen Sui +9
2026-03-18
Robotics · Computer Science
GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model
Ali Abouzeid, Malak Mansour, Qinbo Sun, Zezhou Sun +1
2026-03-10
Robotics · Computer Science
cVLA: Towards Efficient Camera-Space VLAs
Max Argus, Jelena Bratulic, Houman Masnavi, Maxim Velikanov +3
2025-12-23
Robotics · Computer Science
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
Zhongyi Zhou, Yichen Zhu, Junjie Wen, Chaomin Shen +1
2025-06-02
Robotics · Computer Science
PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance
Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng +11
2026-04-27
Computer Vision and Pattern Recognition · Computer Science
Unlocking Dense Metric Depth Estimation in VLMs
Hanxun Yu, Xuan Qu, Yuxin Wang, Jianke Zhu +1
2026-05-21
Robotics · Computer Science
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
Zhenyang Liu, Yongchong Gu, Yikai Wang, Xiangyang Xue +1
2026-01-14
Robotics · Computer Science
IA-VLA: Input Augmentation for Vision-Language-Action models in settings with semantically complex tasks
Eric Hannus, Miika Malin, Tran Nguyen Le, Ville Kyrki
2025-09-30
Robotics · Computer Science
Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo +3
2025-12-16
Computer Vision and Pattern Recognition · Computer Science
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
Boyuan Chen, Zhuo Xu, Sean Kirmani, Brian Ichter +5
2024-01-23
Robotics · Computer Science
Survey of Vision-Language-Action Models for Embodied Manipulation
Haoran Li, Yuhui Chen, Wenbo Cui, Weiheng Liu +4
2025-11-13
Computer Vision and Pattern Recognition · Computer Science
VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation
Hanyu Zhou, Chuanhao Ma, Gim Hee Lee
2025-11-24