Dodrio:利用交互式可视化探索Transformer模型
计算与语言
2021-06-08 v3 人工智能
人机交互
机器学习
摘要
为何大型预训练基于transformer的模型能在广泛的各类NLP任务中表现如此优异?近期研究表明,关键可能在于多头注意力机制学习和表示语言信息的能力。理解这些模型如何表示句法与语义知识,对于探究其成败原因、已学内容以及改进方向至关重要。我们提出Dodrio,一个开源交互式可视化工具,以帮助NLP研究者和从业者结合语言知识分析基于transformer模型中的注意力机制。Dodrio紧密集成概览视图(总结不同注意力头的作用)与细粒度视图(帮助用户将注意力权重与输入文本中的句法结构和语义信息进行比较)。为促进注意力权重与语言知识的视觉比较,Dodrio应用不同图可视化技术来表示可扩展至较长输入文本的注意力权重。案例研究凸显了Dodrio如何为理解基于transformer模型中的注意力机制提供洞见。Dodrio可在 https://poloclub.github.io/dodrio/ 获取。
引用
@article{arxiv.2103.14625,
title = {Dodrio: Exploring Transformer Models with Interactive Visualization},
author = {Zijie J. Wang and Robert Turko and Duen Horng Chau},
journal= {arXiv preprint arXiv:2103.14625},
year = {2021}
}
备注
10 pages, 8 figures, Accepted to ACL 2021. For a demo video, see https://youtu.be/qB-T9j7UTgE . For a live demo, see https://poloclub.github.io/dodrio/