评估非反思性对齐的稳定性
人工智能
2024-08-28 v1
摘要
人工智能对齐的许多理论障碍是反思稳定性问题的后果——即设计一种即使人工智能有机会也不会禁用的对齐机制的问题。然而,源于反思稳定性的问题在当前的大语言模型(LLM)中并不明显,这导致对于是否需要解决这些问题以实现认知劳动的可靠委托存在分歧。在本文中,我们提出了反事实优先级变化(CPC)失稳机制,作为未来LLM中可能出现反思稳定性问题的机制。我们描述了CPD失稳的两个风险因素:基于CPC的退后思考和偏好不稳定性。我们为每个风险因素开发了初步评估方法,并将其应用于前沿LLM。我们的研究结果表明,在当前LLM中,规模和能力的增加与基于CPC的退后思考和偏好不稳定性的增加相关,这表明CPC失稳可能导致未来LLM出现反思稳定性问题。
关键词
引用
@article{arxiv.2408.15116,
title = {Evaluating Stability of Unreflective Alignment},
author = {James Lucassen and Mark Henry and Philippa Wright and Owen Yeung},
journal= {arXiv preprint arXiv:2408.15116},
year = {2024}
}