基于UNITER的富多模态输入情境化共指消解
计算与语言
2021-12-08 v1 人工智能
摘要
我们展示了作为第十届对话系统技术挑战赛(DSTC10)一部分,在情境化交互式多模态对话2.0(SIMMC 2.0)数据集上进行的多模态共指消解任务工作。我们提出了一种基于UNITER的模型,利用富多模态上下文(如文本对话历史、对象知识库和视觉对话场景)来判断当前场景中的每个对象是否在当前对话轮次中被提及。结果显示所提方法大幅优于官方DSTC10基线,在开发集上对象F1分数从36.6%提升至77.3%,证明了来自富多模态输入的对象表示的有效性。我们的模型在对象共指消解任务的官方评估中排名第二,模型集成后F1分数为73.3%。
引用
@article{arxiv.2112.03521,
title = {UNITER-Based Situated Coreference Resolution with Rich Multimodal Input},
author = {Yichen Huang and Yuchen Wang and Yik-Cheung Tam},
journal= {arXiv preprint arXiv:2112.03521},
year = {2021}
}