中文

大语言模型在碰撞叙事分析中的表现——ChatGPT、BARD与GPT-4的比较研究

计算与语言 2023-08-29 v1 人工智能 信息检索 机器学习

摘要

在交通安全研究中,利用文本分析从碰撞叙事中提取信息是常见做法。随着大语言模型(LLM)的近期进展,了解主流LLM接口在从碰撞叙事中分类或提取信息方面的表现颇具价值。为此,本研究使用了三款最流行的公开可用LLM接口——ChatGPT、BARD和GPT-4。研究考察了它们从爱荷华州与堪萨斯州100份碰撞叙事中提取信息及回答事故相关查询的效用与边界。调研中评估了它们的能力与局限,并比较了对查询的回应。针对叙事提出了五个问题:1)谁负有责任?2)碰撞方式为何?3)碰撞是否发生于施工区?4)碰撞是否涉及行人?5)碰撞中有害事件的顺序为何?对于问题1至4,各LLM间的总体相似度分别为70%、35%、96%和89%。在回答需二元响应的直接问题时相似度较高,而对复杂问题则显著更低。为比较对问题5的回应,分析了网络图与中心性测度。三个LLM的网络图并非总是一致,尽管它们有时具有相同的高入度、出度与介数中心性的影响事件。本研究建议采用多模型从叙事中提取可用信息,且在利用这些接口获取关键安全相关信息时须保持谨慎。

关键词

引用

@article{arxiv.2308.13563,
  title  = {Large Language Models in Analyzing Crash Narratives -- A Comparative Study of ChatGPT, BARD and GPT-4},
  author = {Maroa Mumtarin and Md Samiullah Chowdhury and Jonathan Wood},
  journal= {arXiv preprint arXiv:2308.13563},
  year   = {2023}
}