情感性迁移假说:用于对齐与可解释性
人工智能
2025-05-26 v1 神经元与认知
摘要
AI 对齐是一门旨在开发方法,确保智能体始终以符合其人类操作员目标和价值观的方式行动的研究领域,无论其能力水平如何。本文提出一种情感主义方法来解决对齐问题,通过将目标和价值观概念重新表述为情感性迁移,并通过援引发育心理学和计算神经科学的最新研究来解释情感价值的出现。我们综述了当前的研究进展,并在此基础上提出了基于迁移导航的情感计算模型。我们讨论了在可分析模型生物体中,该模型反映出生物学迁移导航方面特征的证据。我们以对情感性迁移在AI对齐中的作用展开讨论。
引用
@article{arxiv.2505.17024,
title = {An Affective-Taxis Hypothesis for Alignment and Interpretability},
author = {Eli Sennesh and Maxwell Ramstead},
journal= {arXiv preprint arXiv:2505.17024},
year = {2025}
}