中文

迷失于翻译,寻获于片段:多语言社交媒体中诉求的识别

计算与语言 2023-10-30 v1

摘要

诉求片段识别(CSI)是事实核查流程中的重要一步,旨在识别社交媒体帖子中包含值得核查的诉求或断言的文本段。尽管它对记者和人类事实核查员十分重要,该问题仍严重研究不足,且迄今 scarce 的研究仅聚焦于英语。本文旨在通过创建一个新颖的数据集 X-CLAIM 来弥补这一差距,该数据集由从多个社交媒体平台收集的五种印度语言及英语的7K真实世界诉求组成。我们报告了使用最先进的仅编码器语言模型(如 XLM-R)的强基线,并展示了在多语言上训练相较于从英语等高资源语言进行零样本迁移或翻译数据训练等替代跨语言迁移方法的优势。我们使用 GPT 系列的生成式大语言模型(LLM)通过提示方法在 X-CLAIM 数据集上评估,发现它们对于低资源语言表现不如较小的仅编码器语言模型。

关键词

引用

@article{arxiv.2310.18205,
  title  = {Lost in Translation, Found in Spans: Identifying Claims in Multilingual Social Media},
  author = {Shubham Mittal and Megha Sundriyal and Preslav Nakov},
  journal= {arXiv preprint arXiv:2310.18205},
  year   = {2023}
}

备注

EMNLP 2023 (main)