Ethics2vec:对齐自动代理与人类偏好
人工智能
2025-08-12 v1 机器学习
摘要
虽然智能代理旨在改善或提高人类体验,但从人类视角看,难以把握嵌入代理行为中的显性或隐性伦理价值。这就是所谓的对齐问题,即设计与人类价值、目标与偏好相吻合的 AI 系统的挑战。此问题尤为棘手,因为大多数人类伦理考量涉及不可衡量性(incommensurable,即不可度量且不可比较)的价值与标准。例如,医疗代理为恶性病人处方治疗时,如何考虑人类生命价值与治疗成本的不可比较性?只有定义一个公共空间并在其中建立度量标准,才能实现人类与人工价值之间的对齐。本文提出将 Ethics2vec 方法扩展于伦理领域,借助已在自然语言处理、推荐系统和图分析等众多类似且难以量化领域取得成功的 Anything2vec 方法。我们提出将自动代理决策(或控制律)策略映射为多变量向量表示,用于比较与评估与人类价值的对齐程度。Ethics2vec 方法首先在自动代理进行二进制决策时引入。随后讨论将自动控制律(如自动驾驶汽车)进行向量化,以展示该方法可扩展至自动控制场景。
引用
@article{arxiv.2508.07673,
title = {Ethics2vec: aligning automatic agents and human preferences},
author = {Gianluca Bontempi},
journal= {arXiv preprint arXiv:2508.07673},
year = {2025}
}