若史料能言:评估大语言模型在历史研究中的辅助作用
信息检索
2023-10-18 v1 人工智能
摘要
近期强大的大语言模型(LLM)的出现,提供了一种针对历史记忆(此处即训练数据)的新型对话式探究形式。我们展示,通过以高度专业化学术来源的向量嵌入增强此类 LLM,可使一种对话式方法为历史学家及人文学科其他研究者所用。具体地,我们评估并展示了 LLM 如何在研究者检视定制语料库(包含但不限于:(1) 一手来源、(2) 专家撰写的二手来源、以及 (3) 两者结合)时辅助研究。相较于数字目录中既有的搜索界面(如元数据与全文搜索),我们评估了 LLM 更丰富的对话风格在两类主要任务上的表现:(1) 问答,以及 (2) 数据抽取与组织。我们证明,LLM 在具体问题任务上的语义检索与推理能力可应用于未包含于其训练数据的大型文本档案。因此,LLM 可用与具体研究项目相关的来源增强,并可供研究者私有查询。
引用
@article{arxiv.2310.10808,
title = {If the Sources Could Talk: Evaluating Large Language Models for Research Assistance in History},
author = {Giselle Gonzalez Garcia and Christian Weilbach},
journal= {arXiv preprint arXiv:2310.10808},
year = {2023}
}
备注
Will be published at CHR2023