中文

以可解释性规制语言模型很可能导致性能权衡

机器学习 2024-12-18 v1 人工智能 计算机与社会

摘要

规制越来越被视为机器学习中最重要和最紧迫的问题。然而,目前尚不清楚如何实现这一点,或许更重要的是,如果真正实现,它将如何影响模型性能以及人机协作。在本文中,我们试图通过构建一个可规制的的大语言模型(LLM)来回答这些问题,然后量化所涉及的额外约束如何影响(1)模型性能以及(2)人机协作。我们的实证结果表明,强制 LLM 以透明的方式使用人类定义的特征是可能的,但一种以前未被考虑的“规制性能权衡”以分类性能下降 7.34% 的形式显现出来。然而令人惊讶的是,我们表明,尽管如此,在现实的部署环境中,与没有 AI 辅助相比,此类系统实际上提高了人类的任务执行速度和适当的置信度,从而为公平、可规制且有益于用户的 AI 铺平了道路。

关键词

引用

@article{arxiv.2412.12169,
  title  = {Regulation of Language Models With Interpretability Will Likely Result In A Performance Trade-Off},
  author = {Eoin M. Kenny and Julie A. Shah},
  journal= {arXiv preprint arXiv:2412.12169},
  year   = {2024}
}