LLM 指导语义引导式文本分类:面向可解释 Tsetlin 机器
计算与语言
2026-04-15 v1 人工智能
机器学习
摘要
预训练语言模型(PLMs)如 BERT 提供强大的语义表征,但成本高昂且缺乏透明度;而符号模型如 Tsetlin 机器(TM)则提供透明度但缺乏语义泛化能力。我们提出了一种语义引导框架,将 LLM 知识转化为符号形式,实现可解释性与语义能力的结合。给定类别标签,LLM 生成次要意图,以指导通过三阶段课程(seed、core、enriched)创建合成数据,扩展语义多样性。NTM 从这些示例中学习,以提取高置信度的文字作为可解释语义线索。将这些线索注入真实数据后,TM 能够将子句逻辑与 LLM 推断的语义对齐。该方法无需嵌入或运行时 LLM 调用,却为符号模型注入了预训练的语义先验。在多个文本分类任务中,该方法在可解释性和准确率上均优于 vanilla TM,实现的性能可与 BERT 持平,同时保持完全符号化和高效。
关键词
引用
@article{arxiv.2604.12223,
title = {LLM-Guided Semantic Bootstrapping for Interpretable Text Classification with Tsetlin Machines},
author = {Jiechao Gao and Rohan Kumar Yadav and Yuangang Li and Yuandong Pan and Jie Wang and Ying Liu and Michael Lepech},
journal= {arXiv preprint arXiv:2604.12223},
year = {2026}
}
备注
Accepted to Findings of the Association for Computational Linguistics (ACL 2026)