驯服CATS:通过控制令牌指令微调实现可控自动文本简化
计算与语言
2026-04-03 v1
摘要
可控自动文本简化(CATS)产生面向用户定制的输出,但可控性常被当作解码问题来处理,且评估指标不够反映控制程度。我们观察到,CATS的可控性显著受限于数据和评估。为此,我们提出一种基于指令微调的域无关CATS框架,通过离散控制令牌引导开源模型实现可读性水平和压缩率的目标。我们在四个模型家族(Llama、Mistral、Qwen;1-14B)和四个领域(医疗、公共行政、新闻、百科全书)中进行实验,发现较小的模型(1-3B)可与竞争,但可靠的可控性强烈依赖于训练数据是否编码了足够的目标属性变化。可读性控制(FKGL、ARI、Dale-Chall)学习得较好,而压缩控制因现有语料库中信号变异性有限而表现不佳。我们进一步表明,标准简化和相似度指标不足以衡量控制,动机是对目标-输出对齐进行误差度量。最后,我们的抽样和分层实验表明,朴素的划分会引入分布性不匹配,削弱训练和评估。
引用
@article{arxiv.2604.01779,
title = {Taming CATS: Controllable Automatic Text Simplification through Instruction Fine-Tuning with Control Tokens},
author = {Hanna Hubarava and Yingqiang Gao},
journal= {arXiv preprint arXiv:2604.01779},
year = {2026}
}