撼动根基:交互与控制中序列模型的妄想
机器学习
2021-10-22 v1 人工智能
摘要
近年来语言模型取得的惊人成功重新激发了机器学习研究的热情,诸如 transformer 之类的大型序列模型正被应用于多种领域。然而,一类重要的问题——有目的的自适应行为——仍相对难以捉摸。目前普遍存在一种看法,认为序列模型“缺乏对其行为因果关系的理解”,导致它们因自动暗示性妄想而得出错误推断。在本报告中,我们解释了这种错配的根源,并表明可通过将动作视为因果干预来解决。最后,我们展示了在监督学习中,通过分别用事实与反事实误差信号进行训练,可以教会系统对数据进行条件化或干预。
引用
@article{arxiv.2110.10819,
title = {Shaking the foundations: delusions in sequence models for interaction and control},
author = {Pedro A. Ortega and Markus Kunesch and Grégoire Delétang and Tim Genewein and Jordi Grau-Moya and Joel Veness and Jonas Buchli and Jonas Degrave and Bilal Piot and Julien Perolat and Tom Everitt and Corentin Tallec and Emilio Parisotto and Tom Erez and Yutian Chen and Scott Reed and Marcus Hutter and Nando de Freitas and Shane Legg},
journal= {arXiv preprint arXiv:2110.10819},
year = {2021}
}
备注
DeepMind Tech Report, 16 pages, 4 figures