中文

巴别塔中的踉跄:探究 ChatGPT 的语言识别能力

计算与语言 2024-04-10 v2

摘要

ChatGPT 近来作为一种可执行多种任务的强大 NLP 工具崭露头角。然而,ChatGPT 能处理的语言范围在很大程度上仍属未知。为揭示 ChatGPT 所“知晓”的语言,我们考察其语言识别(LID)能力。为此,我们编撰了 Babel-670,一个涵盖五大洲 24 个语系、代表 670 种语言的基准。Babel-670 中的语言从极高资源到极低资源不一而足。随后我们研究 ChatGPT(GPT-3.5 与 GPT-4 两者)在以下方面的能力:(i) 识别语言名称与语言代码,(ii) 零样本与少样本条件下,(iii) 提供或不提供标签集。与较小的微调 LID 工具相比,我们发现 ChatGPT 落后。例如,其在非洲语言上表现糟糕。我们得出结论:当前大语言模型在充分服务多样化社群之前,仍需进一步开发。

关键词

引用

@article{arxiv.2311.09696,
  title  = {Fumbling in Babel: An Investigation into ChatGPT's Language Identification Ability},
  author = {Wei-Rui Chen and Ife Adebara and Khai Duy Doan and Qisheng Liao and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2311.09696},
  year   = {2024}
}

备注

Accepted to NAACL 2024 Findings