你指的是哪一个?情境对话中的多模态物体识别
计算与语言
2023-03-16 v2 人工智能
计算机视觉与模式识别
摘要
各领域对多模态对话系统的需求不断上升,这凸显了从对话与情境上下文中解读多模态输入的重要性。我们探索了三种解决该问题的方法,并在最大的情境对话数据集 SIMMC 2.1 上进行了评估。我们的最佳方法——场景-对话对齐,相比 SIMMC 2.1 基线将性能提升了约 20% 的 F1 分数。我们就方法的局限性及未来工作的潜在方向提供了分析与讨论。我们的代码已公开于 https://github.com/holylovenia/multimodal-object-identification。
引用
@article{arxiv.2302.14680,
title = {Which One Are You Referring To? Multimodal Object Identification in Situated Dialogue},
author = {Holy Lovenia and Samuel Cahyawijaya and Pascale Fung},
journal= {arXiv preprint arXiv:2302.14680},
year = {2023}
}
备注
Accepted at EACL SRW 2023