认知感知的同源词检测
计算与语言
2021-12-16 v1 人工智能
摘要
同源词的自动检测有助于机器翻译、跨语言信息检索、计算系统发生学以及跨语言命名实体识别等下游 NLP 任务。先前用于同源词检测任务的方法使用基于正字法、语音与语义相似性的特征集。在本文中,我们提出一种新方法,利用从人类读者注视行为中提取的认知特征来丰富特征集。我们为一个小样本同源词收集注视行为数据,并表明提取的认知特征有助于同源词检测任务。然而,注视数据收集与标注是昂贵任务。我们使用收集的注视行为数据预测更大样本的认知特征,并表明预测的认知特征也显著提升任务性能。我们报告相比先前提出的方法,使用收集的注视特征提升 10%,使用预测的注视特征提升 12%。此外,我们发布了收集的注视行为数据以及我们的代码与跨语言模型。
引用
@article{arxiv.2112.08087,
title = {Cognition-aware Cognate Detection},
author = {Diptesh Kanojia and Prashant Sharma and Sayali Ghodekar and Pushpak Bhattacharyya and Gholamreza Haffari and Malhar Kulkarni},
journal= {arXiv preprint arXiv:2112.08087},
year = {2021}
}
备注
Published at EACL 2021