我们的聊天机器人在说谎吗?评估一个基于大语言模型的荷兰语客服聊天机器人的回答正确性
计算与语言
2025-11-18 v2 人工智能
摘要
公司通过在线聊天和聊天机器人来支持客户,以赢得他们的忠诚度。AFAS 是一家荷兰公司,旨在利用大语言模型 (LLMs) 提供的机会,在客户支持团队极少或无需介入的情况下回答客户查询。更复杂的是,目前尚不清楚什么构成正确的回答,尤其是在荷兰语语境下。此外,在可用于训练的数据极少的情况下,挑战在于识别大语言模型生成的答案是否正确,并做到实时判断。本研究首次基于 AFAS 支持团队的决策方式定义了回答的正确性。它利用自然语言生成和自动答案评分系统的文献,来自动化客户支持团队的决策过程。我们研究了需要二元回答(例如,是否可以手动调整税率?)或操作指令(例如,如何手动调整税率?)的问题,以测试我们的自动化方法在多大程度上接近支持团队的评分。我们的方法能在 55% 的案例中识别出错误信息。这项工作展示了自动评估聊天机器人何时可能提供不正确或误导性答案的潜力。具体而言,我们的贡献包括:(1) 评估正确性的定义和指标,以及 (2) 针对区域语言和问题类型提高正确性的建议。
引用
@article{arxiv.2411.00034,
title = {Is Our Chatbot Telling Lies? Assessing Correctness of an LLM-based Dutch Support Chatbot},
author = {Herman Lassche and Michiel Overeem and Ayushi Rastogi},
journal= {arXiv preprint arXiv:2411.00034},
year = {2025}
}
备注
10 pages + 2 pages references, 4 figures