中文

iBERT:通过语义分解实现可解释嵌入

计算与语言 2026-01-27 v2

摘要

我们提出iBERT(可解释BERT),一种编码器,用于产生内在可解释且可控制的嵌入——旨在模块化并暴露语言中如语义或风格结构等判别线索。每个输入标记表示为稀疏、非负的k个语境无关语义向量的混合物,这些向量可汇聚为句子嵌入或直接用于标记级别。这使我们能够在任何解码或下游使用之前进行模块化控制。为证明模型的可解释性,我们在一系列聚焦风格的任务上进行评估。在STEL基准测试中,它在风格表示有效性方面比SBERT风格基线提高约8分,同时在作者身份验证方面保持竞争性能。由于每个嵌入都是可解释语义的结构性组成,我们特别指出特定风格属性被分配到特定语义向量的方式。虽然我们的实验集中于风格建模,但iBERT并不局限于此。其结构化模块化旨在解释数据中存在的判别信号——即使监督信号混合了语义或风格因素,仍能实现泛化。

关键词

引用

@article{arxiv.2510.09882,
  title  = {iBERT: Interpretable Embeddings via Sense Decomposition},
  author = {Vishal Anand and Milad Alshomary and Kathleen McKeown},
  journal= {arXiv preprint arXiv:2510.09882},
  year   = {2026}
}

备注

Accepted to the Main Proceedings of EACL 2026. Camera-ready version