TEI2GO:一种用于快速时间表达式识别的多语言方法
计算与语言
2024-03-26 v1
摘要
时间表达式识别对于理解自然语言文本至关重要。尽管存在诸如 HeidelTime 等高效的系统,但其有限的运行时性能阻碍了它们在大规模应用和生产环境中的采用。在本文中,我们引入了 TEI2GO 模型,其效果与 HeidelTime 相当,但运行时间显著改善,支持六种语言,并在其中四种语言上取得了 state-of-the-art 的结果。为了训练 TEI2GO 模型,我们使用了手动标注的参考语料库,并开发了“Professor HeidelTime”,这是一个用 HeidelTime 标注的新闻文本的综合性弱标注语料库。该语料库共包含 篇文档(涵盖六种语言)和 个时间表达式,是迄今为止用于时间表达式识别的最大开源标注数据集。通过描述这些模型是如何生成的,我们旨在鼓励研究界进一步探索、完善该模型集合并将其扩展到其他语言和领域。代码、标注和模型均开放供研究界探索和使用。这些模型已便捷地托管在 HuggingFace 上,以实现无缝集成和应用。
引用
@article{arxiv.2403.16804,
title = {TEI2GO: A Multilingual Approach for Fast Temporal Expression Identification},
author = {Hugo Sousa and Ricardo Campos and Alípio Jorge},
journal= {arXiv preprint arXiv:2403.16804},
year = {2024}
}