提升多轮对话偏好提取器:从标注灾难到精准偏好提取
计算与语言
2025-08-05 v1
摘要
识别对话系统中的用户偏好是提供满意服务的关键方面。当前研究表明,使用大型语言模型(LLM)微调特定任务的偏好提取器在准确性和泛化性方面表现优异。然而,主要挑战源于获取高质量标注多轮对话数据的困难。准确跟踪用户偏好在对话轮次中的转换不仅需要专业的领域知识和维持上下文一致性(称为"标注灾难"Annotate Disaster),也使模型训练复杂化,因序列依赖学习中的误差传播。受益于观察到多轮偏好提取可分解为迭代执行单轮提取过程的观察,我们提出一种新的对话数据生成框架,称为IterChat. 首先,我们构建新的数据格式,将对话数据分为归因历史偏好和单轮对话。这降低了标注错误的概率并提高了标注效率。然后,为生成高质量且多样化的对话数据集,我们采用GPT4预定义目标偏好提取器任务中的偏好槽位,然后随机抽取槽位及其相应模式值的子集以创建对话数据集。实验结果表明,使用新的对话格式进行微调或仅进行few-shot提示,比原始多轮对话的性能更佳。此外,新的数据格式使标注员效率提高,胜率高出28.4%。
引用
@article{arxiv.2508.01739,
title = {Enhancing the Preference Extractor in Multi-turn Dialogues: From Annotating Disasters to Accurate Preference Extraction},
author = {Cheng Wang and ziru Liu and Pengcheng Tang and Mingyu Zhang and Quanyu Dai and Yue Zhu},
journal= {arXiv preprint arXiv:2508.01739},
year = {2025}
}