无需数据集即可进行下游知识基准测试:响应离散度与领域特定问答准确率呈负相关
计算与语言
2024-08-27 v1 人工智能
摘要
本研究旨在消除创建问答数据集和对聊天机器人LLM响应进行评分的需求,完全基于终端用户的方式,无需访问LLM的内部机制,即可比较特定主题领域中LLM的知识水平。只要LLM能被提示并给定随机种子即可生成不同的响应。本文通过对给定主题领域反复询问同一意见问题来定义LLM的"响应离散度"。即LLM对同一问题生成的响应,其嵌入矩阵中需用多少个奇异值来解释95%的方差。研究发现,响应离散度与相关问答评估的准确率呈负相关(平均spearman秩相关系数大于-0.59)。用例分析显示,当比较同一主题领域中的两个LLM时,比较其响应离散度在74%至89%的情况下可作为比较其问答准确率的替代方案,这一比例取决于用户可接受的某些合理准确率差异容忍度,即使用户为了节省工作量改用响应离散度而可接受的准确率差异范围。本研究还研究了两种响应嵌入:一种来自OpenAI的API,另一种是一种新颖的嵌入,命名为参考句子相似度嵌入,可在本地计算,几乎在计算响应离散度方面表现极佳。本研究还将既有的IRC-Wiki Trivia数据集(最初为游戏开发而创建)重新利用、精选,并命名为IRC-WikiTriviaQA,以供本研究使用。
引用
@article{arxiv.2408.13624,
title = {No Dataset Needed for Downstream Knowledge Benchmarking: Response Dispersion Inversely Correlates with Accuracy on Domain-specific QA},
author = {Robert L Simione},
journal= {arXiv preprint arXiv:2408.13624},
year = {2024}
}
备注
16 pages, 3 tables, 1 figure