面向动态人类价值的超对齐
人工智能
2025-03-19 v1
摘要
对齐的两个核心挑战是1) 可扩展的监督与2) 人类价值动态性的考虑。虽然递归奖励建模等解决方案解决了1),但并未同时考虑2)。我们构思了一种新型算法框架的路线图,用以训练超人类推理模型,将复杂任务分解为仍可由人类水平指导的子任务。我们的方案依赖我们所称的“部分到完整泛化假设”,即子任务解决方案的对齐可推广至完整解决方案的对齐。我们主张需要衡量这种泛化,并提出未来改进其方法。
引用
@article{arxiv.2503.13621,
title = {Superalignment with Dynamic Human Values},
author = {Florian Mai and David Kaczér and Nicholas Kluge Corrêa and Lucie Flek},
journal= {arXiv preprint arXiv:2503.13621},
year = {2025}
}
备注
Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)