基于大型语言模型的数据合成方法:用于主动挖掘旅游领域中隐性用户意图
计算与语言
2025-05-20 v1
摘要
在旅游领域,大型语言模型(LLM)常常难以从游客模糊的询问中挖掘隐性用户意图,缺乏主动引导用户澄清需求的能力。一个关键瓶颈是缺乏高质量的训练数据集,以支持主动提问和隐性意图挖掘。虽然近期的进展利用LLM驱动的数据合成生成此类数据集并将专门知识传递到下游模型,但现有方法存在若干局限:(1)缺乏对旅游领域的适配,(2)初始询问中细节层级分布偏斜,(3)隐性意图挖掘模块中存在上下文冗余,(4)缺乏对游客情绪与意图价值的明确思考。因此,我们提出了SynPT(主动挖掘旅游领域隐性用户意图的数据合成方法),通过构建LLM驱动的用户代理与助理代理,基于从中国旅游网站收集的种子数据模拟对话。该方法解决了上述局限,并生成包含显式推理的SynPT-Dialog训练数据集。该数据集用于微调通用LLM,使其能够主动挖掘隐性用户意图。实验评估从人类和LLM视角均表明,SynPT优于现有方法。此外,我们分析了关键超参数,并提供案例研究以说明该方法的实际适用性,包括对其适用于英语场景的讨论。所有代码和数据均公开可用。
引用
@article{arxiv.2505.11533,
title = {A Data Synthesis Method Driven by Large Language Models for Proactive Mining of Implicit User Intentions in Tourism},
author = {Jinqiang Wang and Huansheng Ning and Tao Zhu and Jianguo Ding},
journal= {arXiv preprint arXiv:2505.11533},
year = {2025}
}