中文

分词至关重要:探索性别包容性语言技术中的数据稀缺分词

计算与语言 2024-04-09 v3 人工智能 机器学习

摘要

性别包容的 NLP 研究记录了以性别二元为中心的大型语言模型的有害局限性,例如无法正确使用性别多元的英语新代词(如 xe, zir, fae)。虽然数据稀缺是已知的原因,但稀缺影响这种行为的精确机制仍有待深入探索。我们发现 LLM 错误指代性别显著受 Byte-Pair Encoding (BPE) 分词的影响,这种分词器为许多流行的 LLM 提供支持。与二元代词不同,BPE 对新代词过度碎片化,这是分词器训练期间数据稀缺的直接后果。这种差异性分词反映了在多语言和低资源 NLP 中观察到的分词器局限性,从而解锁了新的错误指代性别缓解策略。我们提出了两种技术:(1)代词分词对等,一种在性别代词之间强制执行一致分词的方法,以及(2)利用 LLM 现有的代词知识来提高新代词的熟练度。我们提出的方法优于标准 BPE 微调,将新代词的准确率从 14.1% 提高到了 58.4%。我们的论文首次将 LLM 错误指代性别与分词和新代词语法缺陷联系起来,表明无法正确将新代词视为代词的 LLM 更容易发生错误指代性别。

关键词

引用

@article{arxiv.2312.11779,
  title  = {Tokenization Matters: Navigating Data-Scarce Tokenization for Gender Inclusive Language Technologies},
  author = {Anaelia Ovalle and Ninareh Mehrabi and Palash Goyal and Jwala Dhamala and Kai-Wei Chang and Richard Zemel and Aram Galstyan and Yuval Pinter and Rahul Gupta},
  journal= {arXiv preprint arXiv:2312.11779},
  year   = {2024}
}

备注

Accepted to NAACL 2024 findings