中文

通过自然语言模型编辑实现灵活的模型可解释性

计算与语言 2023-11-21 v1 人工智能

摘要

在大型语言模型时代,模型可解释性与模型编辑是至关重要的目标。有趣的是,这两个目标之间存在联系:若某方法能够针对感兴趣的人类概念系统性地编辑模型行为,则该编辑方法可通过指向相关内部表征并系统性地操控它们,来帮助提升内部表征的可解释性。

关键词

引用

@article{arxiv.2311.10905,
  title  = {Flexible Model Interpretability through Natural Language Model Editing},
  author = {Karel D'Oosterlinck and Thomas Demeester and Chris Develder and Christopher Potts},
  journal= {arXiv preprint arXiv:2311.10905},
  year   = {2023}
}

备注

Extended Abstract -- work in progress. BlackboxNLP2023