中文

评估大语言模型在技术语言处理任务上的表现

计算与语言 2024-06-19 v1 信息检索

摘要

本文展示了一项关于大语言模型在技术语言处理任务上表现的评估研究结果。人类经常面临需要从不同来源收集信息并理解大量文本的任务。这些任务对人类来说可能相当复杂,通常需要深入学习,包括重读文本的某些部分。为了简化信息收集任务,我们评估了带有聊天界面的大语言模型,考察它们根据对文本主体的阅读,提供人类预期能够回答的标准问题答案的能力。所研究的文本主体是美国《联邦法规》第47篇,该篇描述了由联邦通信委员会管理的商业电信法规。这一文本主体一直是我们关注的对象,因为我们更广泛的研究涉及以自动化方式理解与无线频谱治理和使用相关的信息,以支持动态频谱接入。关于此无线频谱领域的信息存在于许多不同来源中,《联邦法规》第47篇只是其中之一。通过使用一系列大语言模型并提供所需的CFR文本作为上下文,我们得以量化这些大语言模型在回答以下问题这一特定任务上的表现。

关键词

引用

@article{arxiv.2403.15503,
  title  = {Evaluating the Performance of LLMs on Technical Language Processing tasks},
  author = {Andrew Kernycky and David Coleman and Christopher Spence and Udayan Das},
  journal= {arXiv preprint arXiv:2403.15503},
  year   = {2024}
}