中文

自然语言单元间的相似性:从粗粒度到细粒度估计的转变

计算与语言 2025-09-04 v3

摘要

捕捉人类语言单元之间的相似性对于解释人类如何关联不同对象至关重要,因此其计算受到了广泛关注、研究和应用。随着我们周围信息量的不断增加,计算相似性变得越来越复杂,尤其是在许多情况下,例如法律或医疗事务中,衡量相似性需要格外谨慎和精确,因为语言单元内的细微行为可能产生重大的现实影响。本论文的研究目标是开发能够以更精细的方式解释语言单元间相似性的回归模型。相似性的计算已经取得了长足的进步,但调试这些度量标准的方法通常基于持续拟合人类判断值。为此,我的目标是开发一种能够精确捕捉相似性计算中漏洞的算法。此外,大多数方法对其计算的相似性定义模糊,且通常难以解释。所提出的框架解决了这两个缺点。它通过捕捉不同的漏洞来不断改进模型。此外,模型的每一次细化都提供了合理的解释。本论文引入的回归模型被称为渐进式细化相似性计算,它将攻击测试与对抗训练相结合。本论文的相似性回归模型在处理边缘情况方面达到了最先进的性能。

关键词

引用

@article{arxiv.2210.14275,
  title  = {Similarity between Units of Natural Language: The Transition from Coarse to Fine Estimation},
  author = {Wenchuan Mu},
  journal= {arXiv preprint arXiv:2210.14275},
  year   = {2025}
}

备注

PhD thesis