用于交互式调整词嵌入去偏效果的可视化
人机交互
2025-06-04 v1
摘要
词嵌入将词转换为数值,是一种重要且被广泛使用的自然语言处理技术。词嵌入的一个严重问题是,如果用于预训练的数据集包含偏见,偏见将被学习并影响模型。另一方面,即使偏见对我们来说是不可取的,不加区分地从词嵌入中移除偏见也可能导致信息丢失。因此,由于去偏导致的模型性能下降风险将成为另一个问题。作为该问题的解决方案,我们关注日语中的性别偏见,并提出了一种交互式可视化方法来调整每个词类别的去偏程度。具体而言,我们可视化去偏后在类别分类任务中的准确性,并允许用户根据可视化结果调整参数,从而可以根据用户的目标来调整去偏。此外,考虑到去偏与防止模型性能下降之间的权衡,以及不同人对性别偏见的感知不同,我们开发了一种应用优化方案来呈现多种去偏配置选项的机制。本文展示了我们从日语版 Wikipedia 学习的词嵌入中移除性别偏见的实验结果。我们基于新闻语料库将词分为五个类别,并观察到去偏的影响程度在各类别间差异很大。随后,我们根据可视化结果调整了每个类别的去偏程度。
引用
@article{arxiv.2506.02447,
title = {Visualization for interactively adjusting the de-bias effect of word embedding},
author = {Arisa Sugino and Takayuki Itoh},
journal= {arXiv preprint arXiv:2506.02447},
year = {2025}
}