面向低资源角色对话的结构化风格改写与链路思考规划
计算与语言
2026-05-20 v2 机器学习
摘要
将小型语言模型(SLM)应用于中文角色驱动生成仍面临数据稀缺和难以解耦角色风格的挑战。标准的监督微调(SFT)往往仅捕获表层语义,导致频繁出现角色外输出(Out-Of-Character, OOC)。我们将其建模为受控的句子级风格改写任务,该任务将风格质量从对话上下文管理中隔离。我们提出一种结构化风格改写框架,将角色风格分解为可解释的格式签名、句法和语用维度,并结合链路思考(Chain-of-Thought, CoT)监督实现风格的显式规划。进一步通过链路思考共享的直接偏好优化(CoT-Shared Direct Preference Optimization, DPO)阶段,将风格规划与表层实现对齐,确保偏好学习目标聚焦于输出层级的风格执行而非推理轨迹差异。在八个来自四个多样化源域角色的实验中,我们的方法使 Qwen3-1.7B 模型在保持强语义保真度(0.878)的同时实现 Valid Style Score 达到 ,位于评估系统的帕累托前沿,显著优于更大规模的基线模型(如 GLM-4.7),且仅需消费级硬件即可实现。
引用
@article{arxiv.2603.05933,
title = {Structured Style-Rewrite with Chain-of-Thought Planning for Low-Resource Character Dialogue},
author = {Chanhui Zhu},
journal= {arXiv preprint arXiv:2603.05933},
year = {2026}
}
备注
30 pages, 5 figures. Preprint