NeuroLex:面向EEG报告理解与生成的轻量级领域语言模型
计算与语言
2025-11-18 v1 人工智能
摘要
临床脑电图(EEG)报告编码了领域特定的语言约束,通用语言模型(LM)难以捕获。我们引入NeuroLex,这是一个轻量级领域自适应语言模型,仅基于来自哈佛脑电图数据库的EEG报告文本进行训练。不同于现有的生物医学语言模型,NeuroLex专为EEG报告的语言特征和诊断特征而设计,使其能够作为独立的文本模型和多模态EEG语言系统的解码器主干。通过span-corruption预训练和指令式微调,NeuroLex在报告润色、段落概括和术语问答任务上学习EEG解释的语法和推理模式。全面评估表明,NeuroLex在困惑度、抽取和概括准确性、标签效率以及对否定和事实幻觉的鲁棒性方面,均优于相同规模的通用模型。凭借EEG感知的语言主干,NeuroLex桥接了生物医学文本建模与脑机接口应用,为可解释和语言驱动的神经解码提供了基础。
引用
@article{arxiv.2511.12851,
title = {NeuroLex: A Lightweight Domain Language Model for EEG Report Understanding and Generation},
author = {Kang Yin and Hye-Bin Shin},
journal= {arXiv preprint arXiv:2511.12851},
year = {2025}
}