支持面向戒烟支持小组对话代理的数据增强
计算与语言
2025-12-22 v1
摘要
在线戒烟支持小组经济实惠且易于获取,但常常面临用户参与度低和污名化等挑战。使用自动对话代理可以通过确保所有用户评论得到及时回应来提高参与度。我们通过两级数据增强策略应对高质量数据不足的问题:合成数据增强和真实数据增强。首先,我们微调了一个开源大语言模型,用于分类戒烟支持小组中的帖子并识别F1(精确率+召回率)得分较低的意图。然后,针对这些意图,我们使用提示工程通过GPT模型生成额外的合成数据,平均有87%的生成合成帖子被人工标注者评为高质量。总体而言,合成增强过程导致43%的原始帖子被选中进行增强,随后这些帖子经过140%的合成扩展。此外,我们从相关的在线支持场景中抓取了超过10,000条真实帖子,其中73%被人工标注者验证为高质量。每条合成或抓取的帖子都经过人工评审者的严格验证,以确保质量和相关性。经验证的新数据与原始支持小组帖子合并,形成了用于重新训练意图分类器的增强数据集。重新训练模型的性能评估显示F1提升了32%,证实了我们数据增强方法的有效性。合成和真实帖子增强带来了类似的性能提升。本研究为在数据稀缺领域提升对话代理性能提供了一个可复现的框架。
引用
@article{arxiv.2512.17092,
title = {Data Augmentation Supporting a Conversational Agent Designed for Smoking Cessation Support Groups},
author = {Salar Hashemitaheri and Ian Harris},
journal= {arXiv preprint arXiv:2512.17092},
year = {2025}
}