ChaI-TeA:用于评估 LLM 基于聊天机器人交互自动完成的基准
计算与语言
2025-03-06 v3 人工智能
机器学习
摘要
LLM 的兴起将人机交互的越来越大比例转向 LLM 基于聊天机器人。这些模型的卓越能力使用户能够使用涵盖广泛主题和风格的长篇、多样化自然语言文本进行交互。对这些信息进行表述需要耗时耗力,亟需自动完成解决方案提供帮助。我们提出聊天机器人交互自动完成任务。我们提出 ChaI-TeA:CHat InTEraction Autocomplete;用于 LLM 基于聊天机器人交互自动完成的评估框架。该框架包括任务的正式定义,以及合适的数据集和指标。我们使用该框架评估了 9 个模型在定义的自动完成任务上的表现,发现虽然当前即插即用模型表现相当,但在排序生成建议方面仍有很大提升空间。我们为从事此任务的实践者提供了见解,并为该领域的研究者开辟了新的研究方向。我们公开了该框架,以作为未来研究的基础。
引用
@article{arxiv.2412.18377,
title = {ChaI-TeA: A Benchmark for Evaluating Autocompletion of Interactions with LLM-based Chatbots},
author = {Shani Goren and Oren Kalinsky and Tomer Stav and Yuri Rapoport and Yaron Fairstein and Ram Yazdi and Nachshon Cohen and Alexander Libov and Guy Kushilevitz},
journal= {arXiv preprint arXiv:2412.18377},
year = {2025}
}