中文

比较预训练人类语言模型:以群体、个体特征还是两者结合的人类上下文更好?

计算与语言 2025-07-21 v3 人工智能 机器学习

摘要

预训练语言模型考虑了相邻词和文档的上下文,但缺乏生成文本的人类作者上下文。然而,语言依赖于作者的状体、特质、社会、情境和环境属性,统称为人类上下文(Soni等人,2024)。以人为中心的自然语言处理需要将人类上下文纳入语言模型。目前存在两种方法:使用1)群体属性(例如,45岁以上的人)或2)个体特征进行预训练。群体属性简单但粗糙——并非所有45岁的人写作方式相同——而个体特征允许更个性化的表示,但需要更复杂的建模和数据。目前尚不清楚哪种方法对哪些任务有益。我们通过1)群体属性、2)个体用户和3)组合方法,在五个用户级和文档级任务上比较了带有上下文的预训练模型。我们的结果表明,没有最佳方法,但以人为中心的语言建模为不同方法提供了途径。

关键词

引用

@article{arxiv.2401.12492,
  title  = {Comparing Pre-trained Human Language Models: Is it Better with Human Context as Groups, Individual Traits, or Both?},
  author = {Nikita Soni and Niranjan Balasubramanian and H. Andrew Schwartz and Dirk Hovy},
  journal= {arXiv preprint arXiv:2401.12492},
  year   = {2025}
}