利用大语言模型引导有信息的文本评估
计算与语言
2024-09-04 v4 人工智能
计算机科学与博弈论
摘要
对等预测机制动机下高质量反馈,但当前方法仅适用于较为简单的报告,如多选题或标量数字。我们旨在将这些技术拓展到基于文本的报告领域,借鉴大语言模型的最新发展。这大大增加了对等预测机制的适用性,因为文本反馈是众多反馈渠道中的常规形式:同行评审、电子商务客户评论以及社交媒体评论。我们引入两种机制,即生成式对等预测机制(GPPM)和生成式概述对等预测机制(GSPPM)。这些机制将大语言模型用作预测器,将一个代理的报告映射到对其同事报告的预测。理论上,我们证明当大语言模型预测足够准确时,我们的机制可作为(近似)贝叶斯纳夫均衡 incentivize 高效力和诚实报告。实验上,我们通过在两个真实数据集上的实验确认了我们机制的有效性:Yelp 评论数据集和 ICLR OpenReview 数据集。我们强调,在 ICLR 数据集上,我们的机制能够在预期分数方面区分三个质量水平——人类撰写的评论、GPT-4 生成的评论和 GPT-3.5 生成的评论。此外,GSPPM 比 GPPM 更有效地对大语言模型生成的评论进行惩罚。
引用
@article{arxiv.2405.15077,
title = {Eliciting Informative Text Evaluations with Large Language Models},
author = {Yuxuan Lu and Shengwei Xu and Yichi Zhang and Yuqing Kong and Grant Schoenebeck},
journal= {arXiv preprint arXiv:2405.15077},
year = {2024}
}
备注
Accepted by the Twenty-Fifth ACM Conference on Economics and Computation (EC'24)