使用大型语言模型嵌入追踪思想的谱系
计算与语言
2024-11-20 v1 社会与信息网络
摘要
在本文中,我提出了一种新颖的方法来检测大规模语料库中的思想影响。利用大型语言模型在编码语义和结构意义方面的独特能力,同时保持对释义的鲁棒性,我们可以以计算高效的方式搜索实质相似的思想和思想影响的线索。这种方法使我们能够操作不同级别的置信度:我们可以允许直接引用、释义或推测性相似性,同时保持对每个阈值局限性的开放性。我应用了一种集成方法,结合了通用文本嵌入(一种针对捕获语义内容优化的最先进句子嵌入方法)和抽象意义表示图表示(旨在捕获论证风格和隐喻使用中的结构相似性)。我将此方法应用于向量化来自约40万本19世纪非虚构书籍和学术出版物的语料库中的句子,以查找达尔文出版物中出现的思想和论点的实例。这作为初步评估和概念验证;该方法不限于检测达尔文思想,而是能够在各种语料库和上下文中大规模检测相似性。
引用
@article{arxiv.2402.01661,
title = {Tracing the Genealogies of Ideas with Large Language Model Embeddings},
author = {Lucian Li},
journal= {arXiv preprint arXiv:2402.01661},
year = {2024}
}