多方对话中的多语言共指消解
计算与语言
2023-07-11 v2 人工智能
摘要
现有的用于实体共指消解的多方对话数据集尚处于起步阶段,诸多挑战仍待解决。我们基于电视转写文本为此任务创建了一个大规模数据集 Multilingual Multiparty Coref(MMC)。鉴于多种语言中黄金质量字幕的可获得性,我们提出复用标注,通过标注投影在其他语言(中文与波斯语)中创建银标共指消解数据。在黄金(英语)数据上,现成模型在 MMC 上表现相对较差,表明 MMC 比先前数据集具有更广的多方共指覆盖。在银标数据上,我们发现无论是将其用于数据增强还是从头训练均取得成功,有效模拟了零样本跨语言设定。
引用
@article{arxiv.2208.01307,
title = {Multilingual Coreference Resolution in Multiparty Dialogue},
author = {Boyuan Zheng and Patrick Xia and Mahsa Yarmohammadi and Benjamin Van Durme},
journal= {arXiv preprint arXiv:2208.01307},
year = {2023}
}