中文

基于生成式语言模型的大规模文本分析:以人工智能专利中公共价值表述发现为例

计算与语言 2024-12-31 v2 信息检索

摘要

数据标注对于训练文本分类器至关重要,但往往难以准确完成,尤其是对于复杂和抽象的概念。为寻求改进方法,本文采用一种新方法,利用生成式语言模型(GPT-4)来为大规模文本分析生成标签与理由。我们将该方法应用于在美国人工智能专利中发现公共价值表述的任务。我们使用提交至 InnovationQ+ 的高级布尔查询收集了包含 154,934 份专利文档的数据库。结果与美国专利商标局(USPTO)的完整专利文本合并,得到 540 万句句子。我们设计了一个框架,用于识别和标注这些人工智能专利句子中的公共价值表述。我们开发了面向 GPT-4 的提示,其中包含文本分类的定义、指南、示例与理由。我们使用 BLEU 分数和主题建模评估 GPT-4 生成的标签与理由的质量,发现它们准确、多样且忠实。这些理由还充当模型的思维链、用于人工验证的透明机制,并辅助人工标注者克服认知局限。我们得出结论,GPT-4 从我们的框架中实现了对公共价值理论的高水平识别,并利用该理论发现未见过的公共价值表述。我们使用 GPT-4 生成的标签训练基于 BERT 的分类器,并对整个数据库中的句子进行预测,在 3 类(0.85)和 2 类分类(0.91)任务上取得了高 F1 分数。我们讨论了该方法对处理具有复杂和抽象概念的大规模文本分析的意义,并建议通过精心框架设计和交互式人工监督,生成式语言模型可在标注生成的质量以及减少时间与成本方面带来显著优势。

关键词

引用

@article{arxiv.2305.10383,
  title  = {Large-Scale Text Analysis Using Generative Language Models: A Case Study in Discovering Public Value Expressions in AI Patents},
  author = {Sergio Pelaez and Gaurav Verma and Barbara Ribeiro and Philip Shapira},
  journal= {arXiv preprint arXiv:2305.10383},
  year   = {2024}
}

备注

13 pages, 3 figures. Update corrects ORCID ID, adds arXiv citation. No other changes