中文

脑-文本基准测试'24:所学经验

计算与语言 2024-12-24 v1 机器学习 神经元与认知

摘要

语音脑-计算机接口旨在从神经活动中解读用户想说的话,为瘫痪患者恢复可理解的交流能力。脑-文本基准测试'24及其关联竞赛旨在推动将神经活动转换为文本的解码算法的发展。本文总结了于2024年6月1日结束的竞赛所学经验(前4名选手也在录制的网络研讨会中展示了其经验)。在准确率方面获得最大提升的是集成方法,即将多个独立解码器的输出通过微调的大型语言模型(LLM)合并(该方法被所有3名前名选手采用)。通过改进基线循环神经网络(RNN)模型的训练方式也取得了性能提升,包括优化学习率调度并使用双音训练目标。改进模型架构本身的尝试证明更为困难,但尝试使用深度状态空间模型或变换器尚未显示出超越RNN基线的优势。该基准测试将持续开放,以支持进一步工作,提高脑-文本算法的准确率。

关键词

引用

@article{arxiv.2412.17227,
  title  = {Brain-to-Text Benchmark '24: Lessons Learned},
  author = {Francis R. Willett and Jingyuan Li and Trung Le and Chaofei Fan and Mingfei Chen and Eli Shlizerman and Yue Chen and Xin Zheng and Tatsuo S. Okubo and Tyler Benster and Hyun Dong Lee and Maxwell Kounga and E. Kelly Buchanan and David Zoltowski and Scott W. Linderman and Jaimie M. Henderson},
  journal= {arXiv preprint arXiv:2412.17227},
  year   = {2024}
}