动物的对齐中期训练
计算与语言
2026-05-05 v3 人工智能
摘要
我们通过使用合成文档进行中期训练,以动物同情心这一既本身重要又与现有对齐工作正交的价值观为例,研究了价值观对齐的鲁棒性。为评估富有同情心的推理,我们开发并公开发布了动物规范道德评估(ANIMA),这是一个包含26个问题、涵盖13个伦理维度的评估,可作为数据集和Inspect评估公开获取。在ANIMA上,使用3000个文档进行训练达到了77%的性能,而指令微调方法仅为40%,并且泛化到了人类同情心,同时在标准安全基准测试或能力上没有下降。然而,后续不相关的指令微调削弱了干预效果,在5000个样本后优势消失。我们的探索性结果表明,基于文档的价值观干预可能需要明确的保留策略才能在典型的训练流程中保持有效。
引用
@article{arxiv.2604.13076,
title = {Alignment midtraining for animals},
author = {Jasmine Brazilek and Miles Tidmarsh},
journal= {arXiv preprint arXiv:2604.13076},
year = {2026}
}
备注
34 pages