中文社交媒体对话的多模态指代消解:数据集与基准方法
计算与语言
2025-05-20 v2
摘要
多模态指代消解 (MCR) 旨在识别跨不同模态(如文本和视觉)指代同一实体的mention,是理解多模态内容的关键。在多模态内容快速增长和社交媒体时代,MCR 对解释用户交互、桥接文本-视觉参考以提高沟通和个性化尤为关键。然而,由于缺乏足够的数据资源,MCR 在真实世界对话中的研究仍未探索。为填补这一空白,我们引入TikTalkCoref,第一个来源于流行的抖音短视频平台的中文多模态指代消解数据集,用于真实场景下的社交媒体。该数据集将短视频与来自用户评论的对应文本对话配对,并为文本中的人物mention以及对应视频帧中的核心指代人物区域进行手动注释。我们还提出了一种有效的 MCR 基准方法,聚焦于明星领域,并在数据集上进行大规模实验,为该数据集提供可靠的基准结果。我们将发布 TikTalkCoref 数据集以促进此领域在真实社交媒体对话中 MCR 的未来研究。
引用
@article{arxiv.2504.14321,
title = {Multimodal Coreference Resolution for Chinese Social Media Dialogues: Dataset and Benchmark Approach},
author = {Xingyu Li and Chen Gong and Guohong Fu},
journal= {arXiv preprint arXiv:2504.14321},
year = {2025}
}