中文

MultiLexNorm++:面向亚洲语言的统一基准与生成模型

计算与语言 2026-01-26 v1

摘要

社交媒体数据因其信息丰富性而在自然语言处理 (NLP) 领域受到关注已有十年之久,但也带来了处理的挑战。由于语言使用更为非正式、自发,且遵循许多不同的社会方言,NLP 模型的性能往往下降。一个解决方案是将数据转换为标准变体进行处理,称为词汇规范化。为此提出了各种基准和模型。MultiLexNorm 基准旨在统一这些努力,但几乎完全包含拉丁字母中的印欧语系语言。因此,我们提出了 MultiLexNorm 的扩展,覆盖来自不同语言家族的 5 种亚洲语言,使用 4 种不同的脚本。我们展示了以前的最新模型在新语言上的表现更差,并提出一种基于大型语言模型 (LLM) 的新架构,显示出更稳健的性能。最后,我们分析了剩余错误,揭示了该任务的未来方向。

关键词

引用

@article{arxiv.2601.16623,
  title  = {MultiLexNorm++: A Unified Benchmark and a Generative Model for Lexical Normalization for Asian Languages},
  author = {Weerayut Buaphet and Thanh-Nhi Nguyen and Risa Kondo and Tomoyuki Kajiwara and Yumin Kim and Jimin Lee and Hwanhee Lee and Holy Lovenia and Peerat Limkonchotiwat and Sarana Nutanong and Rob Van der Goot},
  journal= {arXiv preprint arXiv:2601.16623},
  year   = {2026}
}