CEREC:一个用于电子邮件对话中实体消歧的语料库
计算与语言
2021-06-03 v2 人工智能
摘要
我们提出了首个用于电子邮件对话中实体消歧(entity resolution)的大规模语料库 CEREC。该语料库包含来自 Enron Email Corpus 的 6001 个电子邮件线程,含有 36,448 封电子邮件消息和 60,383 条实体共指链。标注以最小人工投入的两步过程完成。我们开展了实验以评估所创建语料库上不同特征及四个基线的性能。对于提及识别与共指消解任务,报告的最佳性能为 59.2 F1,突显了改进空间。我们给出了深入的定性与定量错误分析,以理解所考虑基线的局限性。
引用
@article{arxiv.2105.10606,
title = {CEREC: A Corpus for Entity Resolution in Email Conversations},
author = {Parag Pravin Dakle and Dan I. Moldovan},
journal= {arXiv preprint arXiv:2105.10606},
year = {2021}
}