中文

使用大型语言模型嵌入追踪思想的谱系

计算与语言 2024-11-20 v1 社会与信息网络

摘要

在本文中,我提出了一种新颖的方法来检测大规模语料库中的思想影响。利用大型语言模型在编码语义和结构意义方面的独特能力,同时保持对释义的鲁棒性,我们可以以计算高效的方式搜索实质相似的思想和思想影响的线索。这种方法使我们能够操作不同级别的置信度:我们可以允许直接引用、释义或推测性相似性,同时保持对每个阈值局限性的开放性。我应用了一种集成方法,结合了通用文本嵌入(一种针对捕获语义内容优化的最先进句子嵌入方法)和抽象意义表示图表示(旨在捕获论证风格和隐喻使用中的结构相似性)。我将此方法应用于向量化来自约40万本19世纪非虚构书籍和学术出版物的语料库中的句子,以查找达尔文出版物中出现的思想和论点的实例。这作为初步评估和概念验证;该方法不限于检测达尔文思想,而是能够在各种语料库和上下文中大规模检测相似性。

关键词

引用

@article{arxiv.2402.01661,
  title  = {Tracing the Genealogies of Ideas with Large Language Model Embeddings},
  author = {Lucian Li},
  journal= {arXiv preprint arXiv:2402.01661},
  year   = {2024}
}