iScore:解释语言模型如何自动对摘要评分的可视化分析
人机交互
2024-03-08 v1 人工智能
计算机与社会
机器学习
摘要
大型语言模型(LLM)近期爆发式普及,激发了学习工程师将其纳入自动对摘要写作评分的自适应教育工具中。在将 LLM 部署到关键学习环境之前,理解和评估它们至关重要,然而其前所未有的规模和不断增加的参数数量阻碍了透明度,并在它们表现不佳时削弱了信任。通过与几位构建和部署摘要评分 LLM 的学习工程师进行协作的以用户为中心的设计过程,我们刻画了解释其模型的基本设计挑战和目标,包括聚合大型文本输入、跟踪分数来源以及扩展 LLM 可解释性方法。为了解决他们的担忧,我们开发了 iScore,这是一个交互式可视化分析工具,供学习工程师同时上传、评分和比较多个摘要。紧密集成的视图允许用户迭代地修改摘要中的语言,跟踪由此产生的 LLM 分数的变化,并在多个抽象级别上可视化模型权重。为了验证我们的方法,我们在一个月内部署了 iScore 供三位学习工程师使用。我们提出了一个案例研究,其中与 iScore 的交互使一位学习工程师将其 LLM 的评分准确率提高了三个百分点。最后,我们对学习工程师进行了定性访谈,揭示了 iScore 如何使他们在部署期间能够理解、评估并建立对其 LLM 的信任。
引用
@article{arxiv.2403.04760,
title = {iScore: Visual Analytics for Interpreting How Language Models Automatically Score Summaries},
author = {Adam Coscia and Langdon Holmes and Wesley Morris and Joon Suh Choi and Scott Crossley and Alex Endert},
journal= {arXiv preprint arXiv:2403.04760},
year = {2024}
}
备注
Accepted to IUI 2024. 16 pages, 5 figures, 1 table. For a demo video, see https://youtu.be/EYJX-_fQPf0 . For a live demo, visit https://adamcoscia.com/papers/iscore/demo/ . The source code is available at https://github.com/AdamCoscia/iScore