iBERT:通过语义分解实现可解释嵌入
计算与语言
2026-01-27 v2
摘要
我们提出iBERT(可解释BERT),一种编码器,用于产生内在可解释且可控制的嵌入——旨在模块化并暴露语言中如语义或风格结构等判别线索。每个输入标记表示为稀疏、非负的k个语境无关语义向量的混合物,这些向量可汇聚为句子嵌入或直接用于标记级别。这使我们能够在任何解码或下游使用之前进行模块化控制。为证明模型的可解释性,我们在一系列聚焦风格的任务上进行评估。在STEL基准测试中,它在风格表示有效性方面比SBERT风格基线提高约8分,同时在作者身份验证方面保持竞争性能。由于每个嵌入都是可解释语义的结构性组成,我们特别指出特定风格属性被分配到特定语义向量的方式。虽然我们的实验集中于风格建模,但iBERT并不局限于此。其结构化模块化旨在解释数据中存在的判别信号——即使监督信号混合了语义或风格因素,仍能实现泛化。
引用
@article{arxiv.2510.09882,
title = {iBERT: Interpretable Embeddings via Sense Decomposition},
author = {Vishal Anand and Milad Alshomary and Kathleen McKeown},
journal= {arXiv preprint arXiv:2510.09882},
year = {2026}
}
备注
Accepted to the Main Proceedings of EACL 2026. Camera-ready version