Abstract: Vision-Language-Action (VLA) models have recently demonstrated strong capabilities in mapping multimodal inputs to robotic control. However, a critical limitation persists: reasoning and ...
Zhuoyang Liu, Jiaming Liu, Hao Chen, Jiale Yu, Ziyu Guo, Chengkai Hou, Chenyang Gu, Xiangju Mi, Renrui Zhang, Kun Wu, Zhengping Che, Jian Tang, Pheng-Ann Heng ...