衡量大型语言模型的议价能力:一个基准与一种买家增强方法
计算与语言
2024-06-05 v3 计算机科学与博弈论
摘要
议价是人类谈判中重要且独特的一部分。随着由大型语言模型(LLM)驱动的智能体学会谈判并像真人一样行动,如何评估智能体的议价能力仍然是一个未解决的问题。我们首次正式将议价任务描述为不对称不完全信息博弈,定义了多个议价过程中买方和卖方的收益。这使我们能够定量评估智能体在议价任务中的表现。我们收集了一个真实的产品价格数据集 AmazonHistoryPrice,并对各种 LLM 智能体的议价能力进行了评估。我们发现,扮演买方比扮演卖方困难得多,而且增加模型规模并不能有效提高买方的表现。为了应对这一挑战,我们提出了一种名为 OG-Narrator 的新方法,该方法集成了一个确定性的报价生成器来控制买方报价的价格范围,以及一个 LLM 叙述者为生成的报价创建自然语言句子。实验结果表明,OG-Narrator 将买方的成交率从 26.67% 提高到 88.88%,并在所有基线上带来了十倍的利润增长,即使是未经对齐的模型也是如此。
引用
@article{arxiv.2402.15813,
title = {Measuring Bargaining Abilities of LLMs: A Benchmark and A Buyer-Enhancement Method},
author = {Tian Xia and Zhiwei He and Tong Ren and Yibo Miao and Zhuosheng Zhang and Yang Yang and Rui Wang},
journal= {arXiv preprint arXiv:2402.15813},
year = {2024}
}
备注
Accepted by ACL 2024 Findings. The dataset AmazonHistoryPrice and our code are available at https://github.com/TianXiaSJTU/AmazonPriceHistory