中文

电商中融合多信息源问题的答案生成

计算与语言 2025-07-14 v2 机器学习

摘要

在电子商务中,自动问答是一项重要却具挑战性的任务,因为用户针对感兴趣商品发布了数以百万计的问题。因此,对利用商品相关信息快速响应的自动答案生成系统有着巨大需求。可用于回答用户查询的知识源有三:评论、重复或相似问题以及规格参数。有效利用这些信息源将极大帮助我们回答复杂问题。然而,在利用这些源时存在两个主要挑战:(i)存在不相关信息;(ii)评论与相似问题中存在情感歧义。通过本工作,我们提出了一个新颖的流程(MSQAP),其在生成回复前分别对前述源中的丰富信息进行相关性与歧义预测,从而加以利用。实验结果表明,我们的相关性预测模型(BERT-QA)优于所有其他变体,与 BERT-base 基线相比 F1 分数提升 12.36%。我们的生成模型(T5-QA)在所有内容保持指标(如 BLEU、ROUGE)上均优于基线,与性能最高的基线(HSSC-q)相比,ROUGE 平均提升 35.02%,BLEU 平均提升 198.75%。对我们流程的人工评估显示,我们的方法相比生成模型(T5-QA)在准确率上总体提升 30.7%,从而使得我们基于完整流程的方法(MSQAP)提供更准确的答案。据我们所知,这是电商领域首个融合规格参数、相似问题和评论数据等多样源信息自动生成自然语言答案的工作。

关键词

引用

@article{arxiv.2111.14003,
  title  = {Answer Generation for Questions With Multiple Information Sources in E-Commerce},
  author = {Anand A. Rajasekar and Nikesh Garera},
  journal= {arXiv preprint arXiv:2111.14003},
  year   = {2025}
}

备注

7 pages, 10 tables, 1 figure