中文
相关论文

相关论文: Falcon Mamba: The First Competitive Attention-free…

200 篇论文

State-space models (SSMs), such as Mamba (Gu & Dao, 2023), have been proposed as alternatives to Transformer networks in language modeling, by incorporating gating, convolutions, and input-dependent token selection to mitigate the quadratic…

As Large Language Models (LLMs) rapidly advance, we introduce Hunyuan-TurboS, a novel large hybrid Transformer-Mamba Mixture of Experts (MoE) model. It synergistically combines Mamba's long-sequence processing efficiency with Transformer's…

计算与语言 · 计算机科学 2025-07-08 Tencent Hunyuan Team , Ao Liu , Botong Zhou , Can Xu , Chayse Zhou , ChenChen Zhang , Chengcheng Xu , Chenhao Wang , Decheng Wu , Dengpeng Wu , Dian Jiao , Dong Du , Dong Wang , Feng Zhang , Fengzong Lian , Guanghui Xu , Guanwei Zhang , Hai Wang , Haipeng Luo , Han Hu , Huilin Xu , Jiajia Wu , Jianchen Zhu , Jianfeng Yan , Jiaqi Zhu , Jihong Zhang , Jinbao Xue , Jun Xia , Junqiang Zheng , Kai Liu , Kai Zhang , Kai Zheng , Kejiao Li , Keyao Wang , Lan Jiang , Lixin Liu , Lulu Wu , Mengyuan Huang , Peijie Yu , Peiqi Wang , Qian Wang , Qianbiao Xiang , Qibin Liu , Qingfeng Sun , Richard Guo , Ruobing Xie , Saiyong Yang , Shaohua Chen , Shihui Hu , Shuai Li , Shuaipeng Li , Shuang Chen , Suncong Zheng , Tao Yang , Tian Zhang , Tinghao Yu , Weidong Han , Weijie Liu , Weijin Zhou , Weikang Wang , Wesleye Chen , Xiao Feng , Xiaoqin Ren , Xingwu Sun , Xiong Kuang , Xuemeng Huang , Xun Cao , Yanfeng Chen , Yang Du , Zhen Yang , Yangyu Tao , Yaping Deng , Yi Shen , Yigeng Hong , Yiqi Chen , Yiqing Huang , Yuchi Deng , Yue Mao , Yulong Wang , Yuyuan Zeng , Zenan Xu , Zhanhui Kang , Zhe Zhao , ZhenXiang Yan , Zheng Fang , Zhichao Hu , Zhongzhi Chen , Zhuoyu Li , Zongwei Li , Alex Yan , Ande Liang , Baitong Liu , Beiping Pan , Bin Xing , Binghong Wu , Bingxin Qu , Bolin Ni , Boyu Wu , Chen Li , Cheng Jiang , Cheng Zhang , Chengjun Liu , Chengxu Yang , Chengzhong Xu , Chiyu Wang , Chong Zha , Daisy Yi , Di Wang , Fanyang Lu , Fei Chen , Feifei Liu , Feng Zheng , Guanghua Yu , Guiyang Li , Guohua Wang , Haisheng Lin , Han Liu , Han Wang , Hao Fei , Hao Lu , Haoqing Jiang , Haoran Sun , Haotian Zhu , Huangjin Dai , Huankui Chen , Huawen Feng , Huihui Cai , Huxin Peng , Jackson Lv , Jiacheng Shi , Jiahao Bu , Jianbo Li , Jianglu Hu , Jiangtao Guan , Jianing Xu , Jianwei Cai , Jiarong Zhang , Jiawei Song , Jie Jiang , Jie Liu , Jieneng Yang , Jihong Zhang , Jin lv , Jing Zhao , Jinjian Li , Jinxing Liu , Jun Zhao , Juntao Guo , Kai Wang , Kan Wu , Lei Fu , Lei He , Lei Wang , Li Liu , Liang Dong , Liya Zhan , Long Cheng , Long Xu , Mao Zheng , Meng Liu , Mengkang Hu , Nanli Chen , Peirui Chen , Peng He , Pengju Pan , Pengzhi Wei , Qi Yang , Qi Yi , Roberts Wang , Rongpeng Chen , Rui Sun , Rui Yang , Ruibin Chen , Ruixu Zhou , Shaofeng Zhang , Sheng Zhang , Shihao Xu , Shuaishuai Chang , Shulin Liu , SiQi Wang , Songjia Feng , Songling Yuan , Tao Zhang , Tianjiao Lang , Tongkai Li , Wei Deng , Wei Li , Weichao Wang , Weigang Zhang , Weixuan Sun , Wen Ouyang , Wenxiang Jiao , Wenzhi Sun , Wenzhuo Jia , Xiang Zhang , Xiangyu He , Xianshun Ren , XiaoYing Zhu , Xiaolong Guo , Xiaoxue Li , Xiaoyu Ma , Xican Lu , Xinhua Feng , Xinting Huang , Xinyu Guan , Xirui Li , Xu Zhang , Xudong Gao , Xun Luo , Xuxiang Qi , Yangkun Chen , Yangyu Tao , Yanling Xiao , Yantao Mai , Yanze Chen , Yao Ding , Yeting Yang , YiFan Song , Yifan Yang , Yijiao Zhu , Yinhe Wu , Yixian Liu , Yong Yang , Yuanjun Cai , Yuanlin Tu , Yue Zhang , Yufei Huang , Yuhang Zhou , Yuhao Jiang , Yuhong Liu , Yuhui Hu , Yujin Lin , Yun Yang , Yunhao Wang , Yusong Zhang , Zekun Wu , Zelong Zhang , Zhan Yu , Zhaoliang Yang , Zhe Zhao , Zheng Li , Zhenyu Huang , Zhiguang Liu , Zhijiang Xu , Zhiqing Kui , Zhiyin Zeng , Zhiyuan Xiong , Zhuo Han , Zifan Wu , Zigang Geng , Zilong Zhao , Ziyan Tang , Ziyuan Zhu , Zonglei Zhu , Zhijiang Xu

The advent of Transformer and Mamba-based architectures has significantly advanced 3D medical image segmentation by enabling global contextual modeling, a capability traditionally limited in Convolutional Neural Networks (CNNs). However,…

计算机视觉与模式识别 · 计算机科学 2026-03-24 Duy D. Nguyen , Phat T. Tran-Truong

Long-term time series forecasting (LTSF) provides longer insights into future trends and patterns. Over the past few years, deep learning models especially Transformers have achieved advanced performance in LTSF tasks. However, LTSF faces…

机器学习 · 计算机科学 2024-06-28 Aobo Liang , Xingguo Jiang , Yan Sun , Xiaohou Shi , Ke Li

Mamba, a recent selective structured state space model, excels in long sequence modeling, which is vital in the large model era. Long sequence modeling poses significant challenges, including capturing long-range dependencies within the…

计算机视觉与模式识别 · 计算机科学 2024-11-12 Rui Xu , Shu Yang , Yihui Wang , Yu Cai , Bo Du , Hao Chen

Deep learning-based single-channel speaker separation has improved significantly in recent years largely due to the introduction of the transformer-based attention mechanism. However, these improvements come at the expense of intense…

We propose TRAMBA, a hybrid transformer and Mamba architecture for acoustic and bone conduction speech enhancement, suitable for mobile and wearable platforms. Bone conduction speech enhancement has been impractical to adopt in mobile and…

声音 · 计算机科学 2024-05-30 Yueyuan Sui , Minghui Zhao , Junxi Xia , Xiaofan Jiang , Stephen Xia

We introduce F2LLM - Foundation to Feature Large Language Models, a suite of state-of-the-art embedding models in three sizes: 0.6B, 1.7B, and 4B. Unlike previous top-ranking embedding models that require massive contrastive pretraining,…

计算与语言 · 计算机科学 2025-10-03 Ziyin Zhang , Zihan Liao , Hang Yu , Peng Di , Rui Wang

We propose Samba ASR,the first state of the art Automatic Speech Recognition(ASR)model leveraging the novel Mamba architecture as both encoder and decoder,built on the foundation of state space models(SSMs).Unlike transformerbased ASR…

计算与语言 · 计算机科学 2025-01-09 Syed Abdul Gaffar Shakhadri , Kruthika KR , Kartik Basavaraj Angadi

With new sequence models like Mamba and xLSTM, several studies have shown that these models match or outperform the state-of-the-art in single-channel speech enhancement and audio representation learning. However, prior research has…

声音 · 计算机科学 2026-01-22 Nikolai Lund Kühne , Jesper Jensen , Jan Østergaard , Zheng-Hua Tan

Mamba has recently garnered attention as an effective backbone for vision tasks. However, its underlying mechanism in visual domains remains poorly understood. In this work, we systematically investigate Mamba's representational properties…

计算机视觉与模式识别 · 计算机科学 2025-11-25 Timing Yang , Guoyizhe Wei , Alan Yuille , Feng Wang

We release Code Llama, a family of large language models for code based on Llama 2 providing state-of-the-art performance among open models, infilling capabilities, support for large input contexts, and zero-shot instruction following…

Large language models (LLMs) have advanced the state of the art in natural language processing. However, their predominant design for English or a limited set of languages creates a substantial gap in their effectiveness for low-resource…

计算与语言 · 计算机科学 2024-04-04 Peiqin Lin , Shaoxiong Ji , Jörg Tiedemann , André F. T. Martins , Hinrich Schütze

In multivariate time-series forecasting (MTSF), extracting the temporal correlations of the input sequences is crucial. While popular Transformer-based predictive models can perform well, their quadratic computational complexity results in…

机器学习 · 计算机科学 2024-07-23 Shusen Ma , Yu Kang , Peng Bai , Yun-Bo Zhao

Mamba has recently gained widespread attention as a backbone model for point cloud modeling, leveraging a state-space architecture that enables efficient global sequence modeling with linear complexity. However, its lack of local inductive…

计算机视觉与模式识别 · 计算机科学 2025-07-24 Xuanyu Lin , Xiaona Zeng , Xianwei Zheng , Xutao Li

We present Llama-GENBA-10B, a trilingual foundation model addressing English-centric bias in large language models. Built on Llama 3.1-8B and scaled to 10B parameters, Llama-GENBA-10B is continuously pretrained on 164B tokens (82B English,…

Background: Biomedical language models should improve performance on biomedical text while retaining general-domain language ability. For Mamba-based models, this trade-off has not been clearly studied across biomedical literature and…

计算与语言 · 计算机科学 2026-03-19 Ling Yue , Mingzhi Zhu , Sixue Xing , Shaowu Pan , Vijil Chenthamarakshan , Yanbo Wang , Yunning Cao , Payel Das , Tianfan Fu

Recent advancements in imitation learning, particularly with the integration of LLM techniques, are set to significantly improve robots' dexterity and adaptability. This paper proposes using Mamba, a state-of-the-art architecture with…

机器人学 · 计算机科学 2024-09-26 Toshiaki Tsuji

While Mamba has demonstrated strong performance in language modeling, its potential as a speech self-supervised learning (SSL) model remains underexplored, with prior studies limited to isolated tasks. To address this, we explore…

计算与语言 · 计算机科学 2026-04-21 Tzu-Quan Lin , Heng-Cheng Kuo , Tzu-Chieh Wei , Hsi-Chun Cheng , Chun Wei Chen , Hsien-Fu Hsiao , Yu Tsao , Hung-yi Lee