中文

IntentionQA:评估电商场景下语言模型购买意图理解能力的基准

计算与语言 2024-10-01 v2

摘要

增强语言模型 (LM) 在电商情境下理解购买意图的能力,对于其在各种下游任务中的有效协助至关重要。然而,此前的方法往往无法生成在实际电商情境中具有意义且符合人类认知的意图,这引发了语言模型是否真正理解并运用购买意图的质疑。本文提出 IntentionQA,一个双任务多选问答基准,用于评估语言模型对购买意图的理解能力。具体而言,语言模型需基于已购买产品推断意图,并利用这些意图预测额外的购买行为。IntentionQA 包含 4,360 个经过精心挑选的问题,分为三个难度级别,使用自动化管道确保在大型电商平台上的可扩展性。人类评估表明,我们的基准具有高质量且低误报率。广泛实验表明,19 个语言模型在理解产品和意图、联合推理产品与意图等情景中仍表现不足,远远落后于人类水平。我们的代码和数据已公开于 https://github.com/HKUST-KnowComp/IntentionQA。

关键词

引用

@article{arxiv.2406.10173,
  title  = {IntentionQA: A Benchmark for Evaluating Purchase Intention Comprehension Abilities of Language Models in E-commerce},
  author = {Wenxuan Ding and Weiqi Wang and Sze Heng Douglas Kwok and Minghao Liu and Tianqing Fang and Jiaxin Bai and Xin Liu and Changlong Yu and Zheng Li and Chen Luo and Qingyu Yin and Bing Yin and Junxian He and Yangqiu Song},
  journal= {arXiv preprint arXiv:2406.10173},
  year   = {2024}
}

备注

Findings of EMNLP 2024