通过语义聚类评估大语言模型回答中的一致性
计算与语言
2024-10-22 v1 人工智能
摘要
在大型语言模型(LLM)功能中,提供可靠信息至关重要,但报告表明LLM输出缺乏一致性。这种不一致性常被归因于标记抽样的随机性,削弱了用户信任,因为即使针对相同查询也会产生不同响应。本文提出了一种新的评估LLM语义一致性的方法,包括比较不同技术。我们的 approach 评估LLM是否为给定问题提供语义上一致的回答,认识到虽然句子在语法上不同,但可能传达相同含义。此前,增强LLM一致性的主要方法包括:利用外部知识作为上下文(如RAG模式)或使用零-shot-CoT改进LLM本身。我们应用我们的评估方法评估这些技术,并展示了这些方法在提高LLM响应一致性方面的影响跨越37个类别。在TruthfulQA数据集上评估LLM响应时,本研究为每个问题诱导N个响应,并对语义等效句子进行聚类,以衡量跨37个类别的语义一致性。通过此方法,对上述方法在采用前后有效性进行定量分析。
引用
@article{arxiv.2410.15440,
title = {Evaluating Consistencies in LLM responses through a Semantic Clustering of Question Answering},
author = {Yanggyu Lee and Jihie Kim},
journal= {arXiv preprint arXiv:2410.15440},
year = {2024}
}
备注
Accepted to the Trustworthy AI Workshop at IJCAI 2024