FlexiTerm:一种更高效的多词术语柔性识别实现
计算与语言
2021-11-08 v2
摘要
术语是领域特定概念的语言能指。自由文本中多词术语(MWT)的自动识别是一个序列标注问题,通常用有监督机器学习方法解决。其对训练数据人工标注的需求使得此类方法难以跨领域移植。相比之下,FlexiTerm 是一种完全无监督的从领域语料中识别 MWT 的方法。它最初以 Java 实现作为概念验证,但扩展性不佳,在大数据背景下实用价值有限。本文描述其 Python 重实现并比较两种实现的性能。结果表明效率获得重大提升,使 FlexiTerm 从概念验证过渡到生产级应用。
引用
@article{arxiv.2110.06981,
title = {FlexiTerm: A more efficient implementation of flexible multi-word term recognition},
author = {Irena Spasic},
journal= {arXiv preprint arXiv:2110.06981},
year = {2021}
}