缩放与指令微调在语言感知中的作用:模型注意力与人类注意力的比较
计算与语言
2023-10-31 v1 人工智能
摘要
近期的大语言模型(LLMs)展现出理解自然语言的强大能力。由于大多数模型共享相同的基础结构,即 transformer 模块,训练过程中促成其成功的可能因素包括缩放(scaling)与指令微调(instruction tuning)。然而,这些因素如何影响模型的语言感知尚不清楚。本工作比较了多种现有 LLM(LLaMA、Alpaca 和 Vicuna)在不同规模(7B、13B、30B、65B)下的自注意力,以及人类阅读注意力的一方面——眼跳(eye saccade),以评估缩放与指令微调对语言感知的影响。结果表明,缩放通过减少对琐碎模式的依赖增强了类人相似度并改善了有效注意力,而指令微调则没有。然而,指令微调显著增强了模型对指令的敏感性。我们还发现,当前 LLM 的注意力始终更接近于非母语者而非母语者,表明所有模型的语言感知均非最优。我们分析所用的代码与数据已在 GitHub 上公开。
引用
@article{arxiv.2310.19084,
title = {Roles of Scaling and Instruction Tuning in Language Perception: Model vs. Human Attention},
author = {Changjiang Gao and Shujian Huang and Jixing Li and Jiajun Chen},
journal= {arXiv preprint arXiv:2310.19084},
year = {2023}
}