OTCE:基于跨域混合专家的 Hybrid SSM 与 Attention 结构,用于构建 Observer-Thinker-Conceiver-Expresser
计算与语言
2024-07-23 v3 人工智能
摘要
最近的研究表明,将 Mamba 与 Transformer 架构结合(即具有选择性状态空间和二次自注意力机制),在语言建模任务中性能优于仅使用 Mamba 或 Transformer 架构。二次自注意力机制有效缓解了选择性状态空间在处理序列中任意元素长期依赖方面的局限性。我们提出了一种将选择性状态空间模型与二次注意力相连接的位置信息注入方法,并将这两种架构与具有跨域共享的混合专家集成,以便同时享受两者的优势。我们设计了一种更具仿生学思想的新架构:Observer-Thinker-Conceiver-Expresser (OTCE),该架构在语言建模任务中能够与众多中等规模开源语言模型竞争。
引用
@article{arxiv.2406.16495,
title = {OTCE: Hybrid SSM and Attention with Cross Domain Mixture of Experts to construct Observer-Thinker-Conceiver-Expresser},
author = {Jingze Shi and Ting Xie and Bingheng Wu and Chunjun Zheng and Kai Wang},
journal= {arXiv preprint arXiv:2406.16495},
year = {2024}
}