中文

问题标记:大语言模型中的分词器偏差

计算与语言 2024-11-15 v3

摘要

GPT-4和GPT-4o等大语言模型(LLM)的最新进展展现出卓越性能,尤其是在英语等资源丰富的语言中,这得益于确保稳健训练的大规模数据集。相反,这些模型在处理中文和韩文等资源匮乏的语言时表现出局限性,包括幻觉响应等问题仍然普遍存在。本文将这种差异的根源追溯到这些模型固有的分词过程。具体而言,它探讨了分词器词汇表——通常用于加速分词过程并减少标记数量,但独立于实际模型训练数据构建——如何不充分地代表非英语语言。这种错误表征导致未充分训练或未训练标记的传播,从而延续偏差,并引发与数据安全和伦理标准相关的严重问题。我们旨在剖析GPT-4o的分词机制,说明其简化的标记处理方法如何放大这些风险,并提供战略解决方案以减轻相关的安全和伦理问题。通过这项研究,我们强调重新思考分词框架以促进更公平、更安全的AI技术的迫切需求。代码和数据可在https://github.com/yeyimilk/LLMGPT4o获取。

关键词

引用

@article{arxiv.2406.11214,
  title  = {Problematic Tokens: Tokenizer Bias in Large Language Models},
  author = {Jin Yang and Zhiqiang Wang and Yanbin Lin and Zunduo Zhao},
  journal= {arXiv preprint arXiv:2406.11214},
  year   = {2024}
}

备注

11th IEEE Special session on Privacy and Security of Big Data (PSBD 2024)