广撒网:潜在习语表达的鲁棒抽取
计算与语言
2019-11-21 v1
摘要
像“out of the woods”和“up the ante”这样的习语表达给自然语言处理应用带来一系列困难。我们展示了关于我们称之为潜在习语表达(PIE)的标注与抽取工作,PIE 是覆盖习语表达字面与非字面用法的多词表达子类。现有的 PIE 语料库规模小且对不同 PIE 类型的覆盖有限,这阻碍了研究进展。为了进一步推动潜在习语表达的抽取与消歧,需要更大的 PIE 语料库。此外,更大的语料库是获取关于习语表达及其可变性的有价值语言洞察的潜在来源。我们提出自动工具以促进更大 PIE 语料库的构建,通过考察基于词典的 PIE 抽取作为英语预抽取工具的可行性。我们通过评估习语词典的可靠性与覆盖度、PIE 语料库的标注,以及从大型语料库中自动抽取 PIE 来完成此工作。结果表明,词典组合是习语表达的可靠来源,PIE 可以高可靠性标注(0.74–0.91 Fleiss' Kappa),且基于句法分析的 PIE 抽取取得高精度性能(88% F1 分数)。结合互补的 PIE 抽取方法进一步将可靠性提升至超过 92% F1 分数。此外,在具备充足 NLP 工具的条件下,此处提出的抽取方法可扩展至其他类型的多词表达及其他语言。
引用
@article{arxiv.1911.08829,
title = {Casting a Wide Net: Robust Extraction of Potentially Idiomatic Expressions},
author = {Hessel Haagsma and Malvina Nissim and Johan Bos},
journal= {arXiv preprint arXiv:1911.08829},
year = {2019}
}