中文

InCA:利用大型语言模型重新思考车载对话系统评估

计算与语言 2023-11-17 v2 人工智能

摘要

鉴于近期发展中生成式大型语言模型(LLMs)复杂性的提升,对其评估构成重大挑战。此外,如关键绩效指标(KPIs)所示,评估基于LLM的各行业应用性能是一项复杂工作。该任务需要对行业用例和预期系统行为有深刻理解。在汽车工业背景下,现有评估指标不足以评估车载对话问答(ConvQA)系统。这些系统的独特需求——答案可能涉及驾驶员或汽车安全且限定在汽车领域内——凸显了当前指标的局限性。为应对这些挑战,本文引入了一套专为评估车载ConvQA系统性能而定制的KPIs,以及专为这些KPIs设计的数据集。初步且全面的实证评估证实了我们所提方法的有效性。此外,我们研究了在提示中使用不同人物角色的影响,发现其增强了模型在评估中模拟多样观点的能力,反映了不同背景个体对某一主题的感知方式。

关键词

引用

@article{arxiv.2311.07469,
  title  = {InCA: Rethinking In-Car Conversational System Assessment Leveraging Large Language Models},
  author = {Ken E. Friedl and Abbas Goher Khan and Soumya Ranjan Sahoo and Md Rashad Al Hasan Rony and Jana Germies and Christian Süß},
  journal= {arXiv preprint arXiv:2311.07469},
  year   = {2023}
}