理解视觉与语言信息并与人类和环境交互的机器智能
计算机视觉与模式识别
2026-05-26 v1 人工智能
摘要
计算机视觉与自然语言处理交叉的进展对于帮助技术、多媒体查询和机器人等应用至关重要。本论文提出了新颖的架构来提高智能代理在三个关键视觉-语言任务上的表现:图像描述生成、视觉对话和交互式指令跟随。首先,我们解决了视觉表示在图像描述生成中的局限性。传统模型依赖CNN检测器从区域提取的特征,缺乏全局上下文且计算开销高。我们提出了GRIT(Grid and Region-based Image captioning Transformer),一种仅使用Transformer的架构。通过集成基于DETR的检测器中的网格和区域特征,GRIT实现了端到端训练,并在推理准确度和速度上超越了先前方法。其次,我们解决了视觉对话问题,这需要就图像进行多轮对话。挑战在于高效地建模多个输入(图像、问题、历史)之间的相互作用。我们引入了LTMI(Light-weight Transformer for Many Inputs)。利用专门的注意力块,LTMI层在代表能力上与标准Transformer扩展相当,但使用的参数不足其十分之一,这一点在VisDial数据集上已验证。最后,我们研究了用于具身AI的交互式指令遵循,使用ALFRED数据集。我们提出了一个框架,采用两阶段指令解释:首先独立于视觉上下文解码语言指令,以预测临时动作-对象序列,然后与视觉特征融合以进行最终执行。通过多个第三者视图和层次注意力,我们的方法准确地定位了对象,并实现了8.37%的未见测试成功率(state-of-the-art)。
引用
@article{arxiv.2605.24020,
title = {Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments},
author = {Van Quang Nguyen},
journal= {arXiv preprint arXiv:2605.24020},
year = {2026}
}
备注
Doctoral dissertation, Tohoku University, 2022. Uploaded for archival purposes. 146 pages