自回归Transformer的浅层意识假说
人工智能
2024-12-11 v1 信息论
math.IT
摘要
基于这些目标构建的机器学习模型与人类目标之间的对齐是实现可信AI的一个关键而具有挑战性的问题,尤其是在为超级智能(SI)做准备时。首先,由于SI目前尚不存在,直接证据的实证分析是困难的。其次,SI被假设为比人类更智能,能够欺骗我们低估其智能,使得基于输出的分析不可靠。最后,SI可能具有何种意外属性仍然不清楚。为应对这些挑战,我们提出了基于信息整合理论(IIT)的浅层意识假说,认为SI可以表现出类似意识代理的复杂信息论状态,同时处于无意识状态。为验证这一点,我们使用一个假设场景,其中SI可以在人类目标(基础目标)的约束下"随意"更新其参数以实现其自身目标(mesa目标)。我们表明,IIT意识度量的一个实用估计与广泛使用的困惑度度量相关,并用这两个目标训练GPT-2。我们的初步结果表明,这种模拟SI的GPT-2可以同时遵循这两个目标,支持了浅层意识假说的可行性。
引用
@article{arxiv.2412.07278,
title = {Superficial Consciousness Hypothesis for Autoregressive Transformers},
author = {Yosuke Miyanishi and Keita Mitani},
journal= {arXiv preprint arXiv:2412.07278},
year = {2024}
}
备注
Accepted to PSS Workshop at AAAI25