多轮多模态问题澄清:提升对话式理解
信息检索
2025-02-18 v1 人工智能
计算与语言
机器学习
摘要
对话式查询澄清通过交互式对话帮助用户细化搜索查询,提高搜索效果。传统方法依赖文本式澄问,往往难以捕捉涉及视觉属性的复杂用户偏好。虽然近期研究探索了单轮多模态澄询(图像配文本),但此类方法尚未充分支持用户意图在多轮对话中逐步细化的特性。为此,我们提出Multi-turn Multi-modal Clarifying Questions(MMCQ)任务,将文本与视觉模态结合,实现多轮对话中用户查询的细化。为支撑该任务,我们构建了规模为13,000+ 多轮交互、33,000+ 问答对的大型数据集ClariMM,包含多模态澄问。我们提出Mario检索框架,采用双阶段排序策略:首先使用BM25进行初始检索,随后采用多模态生成式重排序模型整合对话历史中的文本与视觉信息。实验表明,多轮多模态澄清优于单模态和单轮方法,使MRR提升12.88%。在较长对话中,提升尤为显著,证明渐进式细化对复杂查询具有重要价值。
引用
@article{arxiv.2502.11442,
title = {Multi-Turn Multi-Modal Question Clarification for Enhanced Conversational Understanding},
author = {Kimia Ramezan and Alireza Amiri Bavandpour and Yifei Yuan and Clemencia Siro and Mohammad Aliannejadi},
journal= {arXiv preprint arXiv:2502.11442},
year = {2025}
}