中文

语言模型能否在无时代错觉地代表过去?

计算与语言 2025-05-02 v1

摘要

在研究人员能够用于模拟历史情境的语言模型之前,必须理解时代错觉的风险。我们发现,仅用当代模型通过示例历史文体的 prompt 并不能产生符合该时代风格的输出。微调后可产生足够风格化的文本以蒙蔽自动评判器,但人类评估者仍能区分微调后模型的输出与真实历史文本。我们暂且认为,需在模型预训练时使用历史文体文本,方能可靠地为社会科学研究模拟历史视角。

关键词

引用

@article{arxiv.2505.00030,
  title  = {Can Language Models Represent the Past without Anachronism?},
  author = {Ted Underwood and Laura K. Nelson and Matthew Wilkens},
  journal= {arXiv preprint arXiv:2505.00030},
  year   = {2025}
}