使用自回归语言模型检测视觉 grounding 对话中的指代表达式
计算与语言
2025-06-27 v1 人工智能
摘要
本文探讨了使用纯文本的自回归语言建模方法从视觉 grounding 对话中提取指代表达式的可能性。具体而言,旨在研究仅凭语言上下文 alone 能否为检测具有(可视感知)指代对象的提及(mention)提供信息。为此,我们采用预训练的大语言模型(LLM)执行相对粗糙的提及 span 标注,通过文本中的 next-token 预测来划分提及 span 的边界。我们的发现表明,即使使用较小规模的 LLM、相对较小的数据集和参数高效微调(parameter-efficient fine-tuning),纯文本方法也能有效,凸显了语言上下文对该任务的相对重要性。然而,我们认为该任务本质上是一个多模态问题,并讨论了单模态方法所固有的局限性。
引用
@article{arxiv.2506.21294,
title = {Detecting Referring Expressions in Visually Grounded Dialogue with Autoregressive Language Models},
author = {Bram Willemsen and Gabriel Skantze},
journal= {arXiv preprint arXiv:2506.21294},
year = {2025}
}
备注
Accepted for publication at XLLM @ ACL 2025