风格迁移作为偏差缓解:面向阿拉伯语心理健康文本合成的扩散模型
计算与语言
2026-01-21 v1 人工智能
摘要
合成数据为缓解心理健康分析中的数据稀缺和人口统计偏差提供了一种有前景的解决方案,然而现有方法主要依赖预训练大语言模型(LLMs),这些模型可能输出多样性有限,并传播从其训练数据中继承的偏差。在这项工作中,我们提出了一种无需预训练的基于扩散的合成文本生成方法,将偏差缓解构建为一个风格迁移问题。我们使用存在显著性别不平衡的CARMA阿拉伯语心理健康语料库,专注于男性到女性的风格迁移,以扩充代表性不足的女性作者内容。我们构建了五个数据集,捕捉阿拉伯语中性别表达的不同语言和语义方面,并为每种设置训练了单独的扩散模型。定量评估表明,源文本与生成文本之间具有持续的高语义保真度,同时伴有有意义的表层风格差异,而定性分析则证实了语言上合理的性别转换。我们的结果表明,基于扩散的风格迁移可以在不依赖预训练LLMs的情况下生成高熵、语义忠实的合成数据,为缓解敏感、低资源心理健康领域中的性别偏差提供了一个有效且灵活的框架。
引用
@article{arxiv.2601.14124,
title = {Style Transfer as Bias Mitigation: Diffusion Models for Synthetic Mental Health Text for Arabic},
author = {Saad Mankarious and Aya Zirikly},
journal= {arXiv preprint arXiv:2601.14124},
year = {2026}
}