中文

PolyLingua:基于边距的类间Transformer用于鲁棒的跨领域语言检测

机器学习 2025-12-11 v2

摘要

语言识别是聊天机器人和虚拟助手等多语言系统的关键第一步,能够实现语言和文化上准确的用户体验。此阶段的错误可能级联导致下游失败,对准确性提出了很高的要求。然而,现有的语言识别工具在关键案例上表现不佳——例如歌曲标题与用户语言不同的音乐请求。LangDetect、FastText等开源工具速度快但准确性较低,而大语言模型虽然有效,但往往对低延迟或低资源环境来说成本过高。我们引入PolyLingua,一种用于领域内语言检测和细粒度语言分类的轻量级Transformer模型。它采用两级对比学习框架,结合实例级分离和类级对齐与自适应边距,即使对于密切相关语言也能产生紧凑且良好分离的嵌入。在两个具有挑战性的数据集上评估——Amazon Massive(多语言数字助手话语)和一个歌曲数据集(频繁代码切换的音乐请求)——PolyLingua分别实现了99.25% F1和98.15% F1,超越了Sonnet 3.5,同时使用的参数减少了10倍,使其成为计算和延迟受限环境的理想选择。

关键词

引用

@article{arxiv.2512.08143,
  title  = {PolyLingua: Margin-based Inter-class Transformer for Robust Cross-domain Language Detection},
  author = {Ali Lotfi Rezaabad and Bikram Khanal and Shashwat Chaurasia and Lu Zeng and Dezhi Hong and Hossein Bashashati and Thomas Butler and Megan Ganji},
  journal= {arXiv preprint arXiv:2512.08143},
  year   = {2025}
}