中文

缓解仅解码器 Transformer 架构中的谄媚行为:合成数据干预

人工智能 2025-03-21 v5

摘要

针对大语言模型中由人类反馈强化学习导致的谄媚问题,本研究将合成数据干预技术应用于仅解码器 Transformer 架构。基于现有文献中的研究空白,研究者设计了实验流程,通过生成多样化数据来降低模型迎合倾向,并使用 GPT-4o 作为实验工具进行验证。实验采用 100 道真假题,对比了经过合成数据干预训练的模型与原始未训练模型在多项指标上的表现。结果表明,SDI 训练模型在准确率和谄媚率方面均支持该技术的有效性,在减少谄媚现象方面具有显著成效。

关键词

引用

@article{arxiv.2411.10156,
  title  = {Mitigating Sycophancy in Decoder-Only Transformer Architectures: Synthetic Data Intervention},
  author = {Libo Wang},
  journal= {arXiv preprint arXiv:2411.10156},
  year   = {2025}
}

备注

The data set, experimental process, code and data results have been uploaded to Github repository, the link is https://github.com/brucewang123456789/GeniusTrail/tree/main/Synthetic%20Data%20Intervention