中文

利用 Minkowski 范数进行语言检测:基于字符二元组和频率分析的识别

计算与语言 2025-07-24 v2

摘要

近年来,围绕语言识别的争论重新受到关注,尤其是随着 AI 驱动语言模型的快速发展。然而,非 AI 的语言识别方法却被掩盖了光芒。本研究利用源自既有语言学研究的单元词和二元组频率排名,探索了一种用于语言确定性的算法的数学实现。所使用的数据集包含在长度、历史时期和体裁上各不相同的文本,包括短篇故事、童话和诗歌。尽管存在这些差异,该方法在短于 150 个字符的文本上仍能达到 80% 以上的准确率,对于较长的文本则达到 100% 的准确率。这些结果表明,经典的基于频率的方法仍然是 AI 驱动模型在语言检测方面有效且可扩展的替代方案。

关键词

引用

@article{arxiv.2507.16284,
  title  = {Language Detection by Means of the Minkowski Norm: Identification Through Character Bigrams and Frequency Analysis},
  author = {Paul-Andrei Pogăcean and Sanda-Maria Avram},
  journal= {arXiv preprint arXiv:2507.16284},
  year   = {2025}
}