中文

用于多语言时间与数值表达式抽取与规范化的数据集及基线系统

计算与语言 2023-04-03 v1 人工智能

摘要

时间与数值表达式理解在许多下游自然语言处理(NLP)与信息检索(IR)任务中极为重要。然而,以往许多工作仅覆盖少数子类型且只关注实体抽取,这严重限制了所识别提及的可用性。为使此类实体在下游场景中可用,子类型的覆盖度和粒度十分重要;更为关键的是,提供可操作的具体数值解析。此外,以往大多数工作仅涉及少数几种语言。在此我们描述一个多语言评测数据集——NTX——覆盖14种语言中多样的时间与数值表达式,并涵盖抽取、规范化与解析。连同该数据集,我们提供一个鲁棒的规则基系统作为强基线,用于在此数据集上评估的其他模型对比。数据与代码可在 \url{https://aka.ms/NTX} 获取。

关键词

引用

@article{arxiv.2303.18103,
  title  = {Dataset and Baseline System for Multi-lingual Extraction and Normalization of Temporal and Numerical Expressions},
  author = {Sanxing Chen and Yongqiang Chen and Börje F. Karlsson},
  journal= {arXiv preprint arXiv:2303.18103},
  year   = {2023}
}

备注

Technical Report