Router-Suggest:面向视觉基础对话中多模态自动补全的动态路由
计算与语言
2026-01-12 v1 人工智能
计算机视觉与模式识别
摘要
实时多模态自动补全对于数字助理、聊天机器人、设计工具和医疗咨询至关重要,在这些场景中,用户输入依赖于共享的视觉上下文。我们引入了多模态自动补全(MAC)任务,该任务利用部分输入的文本和视觉线索来预测实时聊天中即将出现的字符。与传统的纯文本自动补全(TAC)不同,MAC将预测建立在多模态上下文之上,以更好地捕捉用户意图。为了实现这一任务,我们改编了MMDialog和ImageChat来创建基准数据集。我们评估了领先的视觉语言模型(VLM)与强大的文本基线,揭示了在准确性和效率方面的权衡。我们提出了Router-Suggest,这是一个路由器框架,它根据对话上下文动态地在文本模型和VLM之间进行选择,并提供了一个适用于资源受限环境的轻量级变体。Router-Suggest相比性能最佳的VLM实现了2.3倍到10倍的加速。一项用户研究表明,VLM在用户满意度上显著优于文本模型,特别是在节省用户输入努力和提高多轮对话中补全质量方面。这些发现强调了自动补全中对多模态上下文的需求,从而导向更智能、更懂用户的助手。
引用
@article{arxiv.2601.05851,
title = {Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs},
author = {Sandeep Mishra and Devichand Budagam and Anubhab Mandal and Bishal Santra and Pawan Goyal and Manish Gupta},
journal= {arXiv preprint arXiv:2601.05851},
year = {2026}
}
备注
Accepted to EACL 2026 Industry Track, 12 pages, 6 figures