中文

词典资源中词义词项与定义的单语对齐

计算与语言 2022-09-07 v1

摘要

本论文的关注点广泛地集中于词典数据的对齐,尤其是词典。为应对该领域中的一些挑战,我们处理了词义对齐与翻译推断两项主要任务。第一项任务旨在给定某词目在两种不同单语词典中的义项定义时,寻找最优对齐。这是一项具有挑战性的任务,尤其由于两种资源在义项粒度、覆盖范围和描述上存在差异。在描述了各类词汇语义资源的特征后,我们引入了一个包含 15 种语言的 17 个数据集的基准,其中单语词义词项与定义由专家在不同资源间人工标注。在基准创建过程中,词典学家的知识通过标注得以融入:为每个义项对选取一种语义关系,即精确、窄义、广义、相关或无。该基准可用于词义对齐系统的评测。若干基于文本与非文本语义相似度检测及语义关系归纳的对齐技术的性能借助该基准进行了评估。最后,我们将此工作扩展至翻译推断,通过基于图分析的多种方法以无监督方式诱导翻译对,从而生成双语词典。该任务对于为资源较少和代表性不足的语言创建词典资源尤为有意义,并有助于增加现有资源的覆盖范围。从实践角度看,本论文中开发的技术与方法已在一个可辅助对齐任务的工具中实现。

关键词

引用

@article{arxiv.2209.02465,
  title  = {Monolingual alignment of word senses and definitions in lexicographical resources},
  author = {Sina Ahmadi},
  journal= {arXiv preprint arXiv:2209.02465},
  year   = {2022}
}

备注

Ph.D. thesis defended at NUI Galway (10.5281/zenodo.5559522)