从其他语言音译而来的专有名词拼写变体聚类
计算与语言
2023-10-13 v1
摘要
处理和操作文本数据的一个显著问题是其非统一性。由于方言和语言的变化,翻译的质量较低。这在使用 NLP 处理文本数据时产生了一个独特的问题,即由不一致翻译和音译引起的拼写变体。将印度语言中的专有名词写成其英文等价形式有多种方式,人为错误会进一步加剧此问题。源自印度语言的专有名词翻译可能很复杂,因为某些专有名词也用作普通名词,可能被字面理解。需要地址、姓名和其他专有名词的 NLP 应用经常面临此问题。我们提出一种利用 ML 技术和数学相似性方程对这些专有名词的拼写变体进行聚类的方法。我们旨在使用亲和传播(Affinity Propagation)来确定词元之间的相对相似性。结果通过以相似性阈值过滤词元-变体对得到增强。我们能够将拼写变体大幅减少。该应用可显著减少数据清洗和格式化所需的人工标注工作。
引用
@article{arxiv.2310.07962,
title = {Clustering of Spell Variations for Proper Nouns Transliterated from the other languages},
author = {Prathamesh Pawar},
journal= {arXiv preprint arXiv:2310.07962},
year = {2023}
}
备注
3 pages, published Airial Conference 2023