中文

模拟数据上的微调优于提示技术用于 agent 语气与风格

机器学习 2025-07-08 v1

摘要

部署语言模型(LM)于客户面向语音应用,需要实现对话流畅性和遵循特定语气指南,这在使用复杂系统提示时可能难以可靠实现,due to 指令遵循限制和情境偏差等问题。本研究探讨了微调与系统提示在对齐 LM 以实现特定行为目标——适用于语音交互的自然对话语气——方面的有效性。我们使用 Low-Rank Adaptation(LoRA)在源自 Wikipedia 的合成数据集上对小型开源模型(`Llama3.2-1B-Instruct`)进行微调。此外,我们还对两个闭源模型(`gpt-4o-mini`, `gpt-4.1-mini`)进行了微调。我们的结果表明,微调优于系统提示,甚至在仅使用 100 个数据样本训练的情况下,也能实现高比例的对话式响应。语义相似性分析确认微调未降低内容质量。有趣的是,采用 8 位整数量化进行微调比使用 bfloat16 精度更快地收敛到目标语气,可能是由于隐式正则化效应。我们得出结论,使用模拟数据对小型开源 LM 进行微调是一种高度有效且数据高效的方法,可为需要细腻响应风格的实际应用提供一种优于复杂系统提示的首选方案。

关键词

引用

@article{arxiv.2507.04889,
  title  = {Fine-tuning on simulated data outperforms prompting for agent tone of voice},
  author = {Ingo Marquardt and Philippe Brule},
  journal= {arXiv preprint arXiv:2507.04889},
  year   = {2025}
}

备注

22 pages, 5 figures, 6 tables