中文

PricingLogic:评估大语言模型在复杂旅游定价任务中的推理能力

人工智能 2025-10-15 v1

摘要

我们提出 PricingLogic,这是第一个探讨大语言模型 (LLM) 在应用于多个重叠票价规则时的旅游定价任务中能否可靠自动化的基准测试。旅行社渴望将这一易出错的任务卸载给 AI 系统;然而,在没有经过验证的可靠性情况下部署 LLM 可能导致重大财务损失并削弱客户信任。PricingLogic 包含 300 个基于 42 个真实世界票价政策派生的自然语言问题,分为两个难度级别:(i) 基本客户类型定价;(ii) 包含相互作用折扣的捆绑旅游计算。对多种 LLM 的评估显示,在更难的层级上表现显著下降,暴露了规则解释和算术推理中的系统性失效。这些结果表明,尽管它们具备通用能力,今天的 LLM 在没有进一步保障或领域适应的情况下,在收入关键应用中仍不可靠。我们的代码和数据集已在 https://github.com/EIT-NLP/PricingLogic 上提供。

关键词

引用

@article{arxiv.2510.12409,
  title  = {PricingLogic: Evaluating LLMs Reasoning on Complex Tourism Pricing Tasks},
  author = {Yunuo Liu and Dawei Zhu and Zena Al-Khalili and Dai Cheng and Yanjun Chen and Dietrich Klakow and Wei Zhang and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2510.12409},
  year   = {2025}
}