语言概率模型应如何构建?
计算与语言
2026-02-10 v1
摘要
全球约有7000多种语言被口语使用,但商业语言识别(LID)系统仅能可靠识别其中几百种书面语言。研究级系统在特定情况下可延伸覆盖范围,但对于大多数语言,覆盖范围仍然零散或不存在。本立场论文认为,这种局面主要是自我设限造成的。具体而言,这源于将语言识别持续表述为无情境文本分类的做法,这掩盖了先验概率估计的核心作用,并受制于鼓励采用全局固定先验模型的制度性激励。我们认为,要提升尾部语言的覆盖率,必须重新思考语言识别作为一种路由问题,并发展原则性方法来整合环境线索,以使语言在特定情境下更具可能性。
引用
@article{arxiv.2602.08951,
title = {How Should We Model the Probability of a Language?},
author = {Rasul Dent and Pedro Ortiz Suarez and Thibault Clérice and Benoît Sagot},
journal= {arXiv preprint arXiv:2602.08951},
year = {2026}
}
备注
Accepted for Vardial 2026