中文

利用情境对齐的线上评论衡量LLM在不同语言变体中的性能差异

计算与语言 2025-03-21 v3 人机交互

摘要

一种语言可能具有不同的变体。这些变体可能影响自然语言处理(NLP)模型的性能,包括大型语言模型(LLM),而这些模型通常在来自广泛使用语言的变体的数据上进行训练。本文提出了一种新颖且高效的评估方法,用于衡量模型在语言变体之间的性能。我们认为,国际线上评论平台(如Booking.com)可作为有效的数据源,用于构建捕获不同语言变体评论的数据集,这些评论来自类似的真实场景,例如针对同一家酒店、相同评分、相同语言(如中文)但不同语言变体(如台湾中文、大陆中文)的评论。为证明此概念,我们构建了一个由台湾中文和大陆中文评论组成的情境对齐数据集,并对六个LLM进行情感分析任务测试。我们的结果显示,LLM在台湾中文上的表现始终低于其他变体。

关键词

引用

@article{arxiv.2502.07058,
  title  = {Using Contextually Aligned Online Reviews to Measure LLMs' Performance Disparities Across Language Varieties},
  author = {Zixin Tang and Chieh-Yang Huang and Tsung-Che Li and Ho Yin Sam Ng and Hen-Hsen Huang and Ting-Hao 'Kenneth' Huang},
  journal= {arXiv preprint arXiv:2502.07058},
  year   = {2025}
}

备注

Accepted by 2025 Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics (NAACL), theme track