细粒度文本分类模型和数据集的视觉分析
计算与语言
2024-03-26 v1
摘要
在自然语言处理中,文本分类任务日益细粒度,因为数据集被分割成更多类别,这些类别更难相互区分。因此,数据集的语义结构变得更加复杂,模型决策也更难解释。适用于粗粒度分类的现有工具在这些额外挑战下表现不佳。针对这一差距,我们与NLP领域专家密切合作,通过迭代设计和评估过程,描述并应对他们在开发细粒度文本分类模型工作流程中日益增长的需求。这次合作的结果是开发了SemLa,一种新颖的视觉分析系统,专门用于1)在模型嵌入空间中对数据集进行空间化时剖析复杂的语义结构,以及2)可视化文本样本含义的细粒度细微差别,以忠实地解释模型推理。本文详细介绍了迭代设计研究和SemLa中的创新功能。最终设计允许通过挖掘词汇和概念模式(包括数据中的偏差和伪影)在不同层次进行对比分析。专家对我们最终设计的反馈和案例研究证实,SemLa是支持模型验证和调试以及数据标注的有用工具。
引用
@article{arxiv.2403.15492,
title = {Visual Analytics for Fine-grained Text Classification Models and Datasets},
author = {Munkhtulga Battogtokh and Yiwen Xing and Cosmin Davidescu and Alfie Abdul-Rahman and Michael Luck and Rita Borgo},
journal= {arXiv preprint arXiv:2403.15492},
year = {2024}
}