针对较大规模语言模型中的生态谬误:引入人类上下文
计算与语言
2026-03-09 v1 人工智能
人机交互
机器学习
摘要
语言模型的训练与推理忽略了一种基本语言事实——由同一作者撰写的多个文本序列之间存在依赖关系。先前的研究表明,通过解决这种形式的生态谬误(ecological fallacy)可以显著提高约1.24亿参数规模的GPT类模型性能。在本工作中,我们探询了通过建模作者的语言上下文(称为HuLM任务)来解决生态谬误,是否为更大规模的模型(如8B Llama模型)提供类似的益处。为此,我们探索了多种处理同一作者其他按时间顺序排列文本中语言情境的变体。我们研究了使用HuLM目标进行预训练,以及在使用作者上下文进行微调(HuFT:Human-aware Fine-Tuning)时的效果。经验比较表明,仅通过QLoRA解决生态谬误在微调阶段即可提升较大8B模型的性能,而标准微调方法则不行。此外,基于QLoRA的持续HuLM预训练结果表明,构建的人类感知模型在八个下游任务上均能实现 improved performance,仅需线性任务分类器训练即可。这些结果表明,建模其原始生成者——作者的语言上下文的实用性与重要性。
引用
@article{arxiv.2603.05928,
title = {Addressing the Ecological Fallacy in Larger LMs with Human Context},
author = {Nikita Soni and Dhruv Vijay Kunjadiya and Pratham Piyush Shah and Dikshya Mohanty and H. Andrew Schwartz and Niranjan Balasubramanian},
journal= {arXiv preprint arXiv:2603.05928},
year = {2026}
}