中文

MUSIED:面向多源异构非正式文本的事件检测基准

计算与语言 2022-11-28 v1

摘要

事件检测(ED)从非结构化文本中识别并分类事件触发词,是信息抽取的一项基础任务。尽管过去几年取得了显著进展,大多数研究工作集中于从正式文本(如新闻文章、维基百科文档、金融公告)中检测事件。此外,每个数据集中的文本要么来自单一来源,要么来自多个但相对同质的来源。随着海量用户生成文本在Web和企业内部不断积累,从这些通常来自多个异构来源的非正式文本中识别有意义的事件,已成为一个具有重要实际价值的问题。作为将事件检测拓展至涉及非正式与异构文本场景的先驱探索,我们基于某领先餐饮服务电商平台中的用户评论、文字对话和电话对话,提出了一个大规模中文事件检测数据集。我们通过定量与定性检视数据样本,仔细考察了所提数据集的文本非正式性与多源异构性特征。采用当前最先进(SOTA)事件检测方法的大量实验验证了这些特征带来的独特挑战,表明多源非正式事件检测仍是一个开放问题,尚需进一步努力。我们的基准与代码发布于 \url{https://github.com/myeclipse/MUSIED}。

关键词

引用

@article{arxiv.2211.13896,
  title  = {MUSIED: A Benchmark for Event Detection from Multi-Source Heterogeneous Informal Texts},
  author = {Xiangyu Xi and Jianwei Lv and Shuaipeng Liu and Wei Ye and Fan Yang and Guanglu Wan},
  journal= {arXiv preprint arXiv:2211.13896},
  year   = {2022}
}

备注

Accepted at EMNLP 2022