用于改进自动同源词检测的词典顺序分割对齐分析
信息检索
2018-11-21 v1 计算与语言
摘要
信息检索中的排序函数常用于搜索引擎中,以推荐与查询相关的答案。本文利用信息检索的这一概念,并将其应用于同源词检测问题域。本文的主要贡献为:(1)位置分割,其融入了顺序概念;(2)图误差建模,其推导变换过程。当前研究工作聚焦于分类问题,即区分一对词是否为同源词。本文关注一个更困难的问题,即我们能否从给定输入预测一个可能的同源词。我们的研究表明,当将语言模型平滑方法作为检索函数并与位置分割和误差建模结合使用时,在同源词分类和预测方面均优于竞争基线。源代码位于:https://github.com/pranav-ust/cognates
引用
@article{arxiv.1811.08129,
title = {Alignment Analysis of Sequential Segmentation of Lexicons to Improve Automatic Cognate Detection},
author = {Pranav A},
journal= {arXiv preprint arXiv:1811.08129},
year = {2018}
}
备注
Published at ACL-SRW 2018