中文

探索 GPT 模型在应试中的有效性:以驾照知识测试为例

计算与语言 2023-08-24 v1 人工智能 机器学习

摘要

诸如 Open AI 的 Generative Pre-trained Transformer (GPT) 模型之类的大语言模型(large language model, LLM)擅长回答问题,但其知识局限于训练数据中所包含的信息。这一局限使它们在面对有关近期进展或非公开文档的问题时表现不佳。我们的研究提出了一种方法,使 GPT 模型能够利用此前未包含在其训练数据中的信息源所提供的上下文来回答问题。该方法包括上下文信息的预处理、上下文与查询的嵌入、通过整合上下文嵌入来构建提示(prompt),以及使用 GPT 模型生成答案。我们以一个受控测试场景应用此方法,使用《加州驾驶手册》作为信息源。GPT-3 模型在一组 50 道驾驶知识测试样题上取得了 96% 的通过分;相比之下,在无上下文时,该模型的通过分降至 82%。然而,即便提供了上下文库,该模型仍未能正确回答部分问题,显示出有待改进之处。本研究还考察了提示长度与上下文格式对模型表现的影响。总体而言,该研就为 GPT 模型在问答任务中的局限性与潜在改进提供了见解。

关键词

引用

@article{arxiv.2308.11827,
  title  = {Exploring the Effectiveness of GPT Models in Test-Taking: A Case Study of the Driver's License Knowledge Test},
  author = {Saba Rahimi and Tucker Balch and Manuela Veloso},
  journal= {arXiv preprint arXiv:2308.11827},
  year   = {2023}
}