中文

行动中的可解释性:对 VPT 这款 Minecraft 智能体的探索性分析

人工智能 2024-07-18 v1

摘要

理解大型基础模型在序列决策任务中所采取决定背后的机制,对于确保此类系统透明且安全至关重要。本文对 Video PreTraining (VPT) Minecraft 玩耍智能体进行探索性分析——该智能体是最大开源视觉基智能体之一。我们旨在通过应用各种可解释性技术来阐明其推理机制。首先,我们分析智能体在解决训练任务——制作钻石镐时所采取的注意力机制。结果显示,该智能体关注最近四帧及其六秒记忆中更远处的若干关键帧。这可能是维持需时 3-10 分钟任务连贯性的一种机制,尽管其记忆跨度较短。其次,我们进行若干干预,帮助我们发现一种令人担忧的目标误泛现象:VPT 将穿着棕色衣物的村民误标识为树干当该村民位于绿树叶下静止时,进而殴打它致死。

关键词

引用

@article{arxiv.2407.12161,
  title  = {Interpretability in Action: Exploratory Analysis of VPT, a Minecraft Agent},
  author = {Karolis Jucys and George Adamopoulos and Mehrab Hamidi and Stephanie Milani and Mohammad Reza Samsami and Artem Zholus and Sonia Joseph and Blake Richards and Irina Rish and Özgür Şimşek},
  journal= {arXiv preprint arXiv:2407.12161},
  year   = {2024}
}

备注

Mechanistic Interpretability Workshop at ICML 2024