English
Related papers

Related papers: ERNIE-M: Enhanced Multilingual Representation by A…

200 papers

English-centric large language models (LLMs) often show strong multilingual capabilities. However, their multilingual performance remains unclear and is under-evaluated for many other languages. Most benchmarks for multilinguality focus on…

Computation and Language · Computer Science 2025-06-03 Amir Hossein Kargaran , Ali Modarressi , Nafiseh Nikeghbal , Jana Diesner , François Yvon , Hinrich Schütze

In this paper, we describe our submission to the WMT19 low-resource parallel corpus filtering shared task. Our main approach is based on the LASER toolkit (Language-Agnostic SEntence Representations), which uses an encoder-decoder…

Computation and Language · Computer Science 2019-06-24 Vishrav Chaudhary , Yuqing Tang , Francisco Guzmán , Holger Schwenk , Philipp Koehn

Many language pairs are low resource, meaning the amount and/or quality of available parallel data is not sufficient to train a neural machine translation (NMT) model which can reach an acceptable standard of accuracy. Many works have…

Computation and Language · Computer Science 2021-11-23 Idris Abdulmumin , Bashir Shehu Galadanci , Abubakar Isa , Habeebah Adamu Kakudi , Ismaila Idris Sinan

Recently multi-lingual pre-trained language models (PLM) such as mBERT and XLM-R have achieved impressive strides in cross-lingual dense retrieval. Despite its successes, they are general-purpose PLM while the multilingual PLM tailored for…

Computation and Language · Computer Science 2025-09-08 Shunyu Zhang , Yaobo Liang , Ming Gong , Daxin Jiang , Nan Duan

Data augmentation is an effective solution to data scarcity in low-resource scenarios. However, when applied to token-level tasks such as NER, data augmentation methods often suffer from token-label misalignment, which leads to…

Computation and Language · Computer Science 2022-03-21 Ran Zhou , Xin Li , Ruidan He , Lidong Bing , Erik Cambria , Luo Si , Chunyan Miao

Multilingual representations pre-trained with monolingual data exhibit considerably unequal task performances across languages. Previous studies address this challenge with resource-intensive contextualized alignment, which assumes the…

Computation and Language · Computer Science 2022-09-20 Wei Zhao , Steffen Eger

Large language models are typically trained densely: all parameters are updated with respect to all inputs. This requires synchronization of billions of parameters across thousands of GPUs. We introduce a simple but effective method to…

Computation and Language · Computer Science 2023-03-27 Suchin Gururangan , Margaret Li , Mike Lewis , Weijia Shi , Tim Althoff , Noah A. Smith , Luke Zettlemoyer

The current dominant approach for neural speech enhancement is based on supervised learning by using simulated training data. The trained models, however, often exhibit limited generalizability to real-recorded data. To address this, this…

Audio and Speech Processing · Electrical Eng. & Systems 2025-03-25 Zhong-Qiu Wang

While most machine translation systems to date are trained on large parallel corpora, humans learn language in a different way: by being grounded in an environment and interacting with other humans. In this work, we propose a communication…

Computation and Language · Computer Science 2018-04-12 Jason Lee , Kyunghyun Cho , Jason Weston , Douwe Kiela

Cross-lingual entity alignment (EA) enables the integration of multiple knowledge graphs (KGs) across different languages, providing users with seamless access to diverse and comprehensive knowledge. Existing methods, mostly supervised,…

Computation and Language · Computer Science 2025-02-13 Soojin Yoon , Sungho Ko , Tongyoung Kim , SeongKu Kang , Jinyoung Yeo , Dongha Lee

Video-and-language pre-training has shown promising improvements on various downstream tasks. Most previous methods capture cross-modal interactions with a transformer-based multimodal encoder, not fully addressing the misalignment between…

Computer Vision and Pattern Recognition · Computer Science 2021-12-24 Dongxu Li , Junnan Li , Hongdong Li , Juan Carlos Niebles , Steven C. H. Hoi

Recent progress on unsupervised learning of cross-lingual embeddings in bilingual setting has given impetus to learning a shared embedding space for several languages without any supervision. A popular framework to solve the latter problem…

Computation and Language · Computer Science 2020-04-21 Pratik Jawanpuria , Mayank Meghwanshi , Bamdev Mishra

Cross-lingual word embeddings are vector representations of words in different languages where words with similar meaning are represented by similar vectors, regardless of the language. Recent developments which construct these embeddings…

Computation and Language · Computer Science 2020-03-04 Yerai Doval , Jose Camacho-Collados , Luis Espinosa-Anke , Steven Schockaert

Currently, large language models (LLMs) predominantly focus on the text modality. To enable more natural human-AI interaction, speech LLMs are emerging, but building effective end-to-end speech LLMs remains challenging due to limited data…

Computation and Language · Computer Science 2026-04-14 Yan Zhou , Qingkai Fang , Yun Hong , Yang Feng

This paper shows that pretraining multilingual language models at scale leads to significant performance gains for a wide range of cross-lingual transfer tasks. We train a Transformer-based masked language model on one hundred languages,…

This paper describes the acquisition, preprocessing, segmentation, and alignment of an Amharic-English parallel corpus. It will be helpful for machine translation of a low-resource language, Amharic. We freely released the corpus for…

Computation and Language · Computer Science 2022-05-04 Andargachew Mekonnen Gezmu , Andreas Nürnberger , Tesfaye Bayu Bati

Entity alignment is to find identical entities in different knowledge graphs. Although embedding-based entity alignment has recently achieved remarkable progress, training data insufficiency remains a critical challenge. Conventional…

Artificial Intelligence · Computer Science 2022-03-15 Kexuan Xin , Zequn Sun , Wen Hua , Bing Liu , Wei Hu , Jianfeng Qu , Xiaofang Zhou

In this report, we introduce ERNIE 5.0, a natively autoregressive foundation model desinged for unified multimodal understanding and generation across text, image, video, and audio. All modalities are trained from scratch under a unified…

Computation and Language · Computer Science 2026-02-05 Haifeng Wang , Hua Wu , Tian Wu , Yu Sun , Jing Liu , Dianhai Yu , Yanjun Ma , Jingzhou He , Zhongjun He , Dou Hong , Qiwen Liu , Shuohuan Wang , Junyuan Shang , Zhenyu Zhang , Yuchen Ding , Jinle Zeng , Jiabin Yang , Liang Shen , Ruibiao Chen , Weichong Yin , Siyu Ding , Dai Dai , Shikun Feng , Siqi Bao , Bolei He , Yan Chen , Zhenyu Jiao , Ruiqing Zhang , Zeyu Chen , Qingqing Dang , Kaipeng Deng , Jiajun Jiang , Enlei Gong , Guoxia Wang , Yanlin Sha , Yi Liu , Yehan Zheng , Weijian Xu , Jiaxiang Liu , Zengfeng Zeng , Yingqi Qu , Zhongli Li , Zhengkun Zhang , Xiyang Wang , Zixiang Xu , Xinchao Xu , Zhengjie Huang , Dong Wang , Bingjin Chen , Yue Chang , Xing Yuan , Shiwei Huang , Qiao Zhao , Xinzhe Ding , Shuangshuang Qiao , Baoshan Yang , Bihong Tang , Bin Li , Bingquan Wang , Binhan Tang , Binxiong Zheng , Bo Cui , Bo Ke , Bo Zhang , Bowen Zhang , Boyan Zhang , Boyang Liu , Caiji Zhang , Can Li , Chang Xu , Chao Pang , Chao Zhang , Chaoyi Yuan , Chen Chen , Cheng Cui , Chenlin Yin , Chun Gan , Chunguang Chai , Chuyu Fang , Cuiyun Han , Dan Zhang , Danlei Feng , Danxiang Zhu , Dong Sun , Dongbo Li , Dongdong Li , Dongdong Liu , Dongxue Liu , Fan Ding , Fan Hu , Fan Li , Fan Mo , Feisheng Wu , Fengwei Liu , Gangqiang Hu , Gaofeng Lu , Gaopeng Yong , Gexiao Tian , Guan Wang , Guangchen Ni , Guangshuo Wu , Guanzhong Wang , Guihua Liu , Guishun Li , Haibin Li , Haijian Liang , Haipeng Ming , Haisu Wang , Haiyang Lu , Haiye Lin , Han Zhou , Hangting Lou , Hanwen Du , Hanzhi Zhang , Hao Chen , Hao Du , Hao Liu , Hao Zhou , Haochen Jiang , Haodong Tian , Haoshuang Wang , Haozhe Geng , Heju Yin , Hong Chen , Hongchen Xue , Hongen Liu , Honggeng Zhang , Hongji Xu , Hongwei Chen , Hongyang Zhang , Hongyuan Zhang , Hua Lu , Huan Chen , Huan Wang , Huang He , Hui Liu , Hui Zhong , Huibin Ruan , Jiafeng Lu , Jiage Liang , Jiahao Hu , Jiahao Hu , Jiajie Yang , Jialin Li , Jian Chen , Jian Wu , Jianfeng Yang , Jianguang Jiang , Jianhua Wang , Jianye Chen , Jiaodi Liu , Jiarui Zhou , Jiawei Lv , Jiaxin Zhou , Jiaxuan Liu , Jie Han , Jie Sun , Jiefan Fang , Jihan Liu , Jihua Liu , Jing Hu , Jing Qian , Jing Yan , Jingdong Du , Jingdong Wang , Jingjing Wu , Jingyong Li , Jinheng Wang , Jinjin Li , Jinliang Lu , Jinlin Yu , Jinnan Liu , Jixiang Feng , Jiyi Huang , Jiyuan Zhang , Jun Liang , Jun Xia , Jun Yu , Junda Chen , Junhao Feng , Junhong Xiang , Junliang Li , Kai Liu , Kailun Chen , Kairan Su , Kang Hu , Kangkang Zhou , Ke Chen , Ke Wei , Kui Huang , Kun Wu , Kunbin Chen , Lei Han , Lei Sun , Lei Wen , Linghui Meng , Linhao Yu , Liping Ouyang , Liwen Zhang , Longbin Ji , Longzhi Wang , Meng Sun , Meng Tian , Mengfei Li , Mengqi Zeng , Mengyu Zhang , Ming Hong , Mingcheng Zhou , Mingming Huang , Mingxin Chen , Mingzhu Cai , Naibin Gu , Nemin Qiu , Nian Wang , Peng Qiu , Peng Zhao , Pengyu Zou , Qi Wang , Qi Xin , Qian Wang , Qiang Zhu , Qianhui Luo , Qianwei Yang , Qianyue He , Qifei Wu , Qinrui Li , Qiwen Bao , Quan Zhang , Quanxiang Liu , Qunyi Xie , Rongrui Zhan , Rufeng Dai , Rui Peng , Ruian Liu , Ruihao Xu , Ruijie Wang , Ruixi Zhang , Ruixuan Liu , Runsheng Shi , Ruting Wang , Senbo Kang , Shan Lu , Shaofei Yu , Shaotian Gong , Shenwei Hu , Shifeng Zheng , Shihao Guo , Shilong Fan , Shiqin Liu , Shiwei Gu , Shixi Zhang , Shuai Yao , Shuang Zhang , Shuangqiao Liu , Shuhao Liang , Shuwei He , Shuwen Yang , Sijun He , Siming Dai , Siming Wu , Siyi Long , Songhe Deng , Suhui Dong , Suyin Liang , Teng Hu , Tianchan Xu , Tianliang Lv , Tianmeng Yang , Tianyi Wei , Tiezhu Gao , Ting Sun , Ting Zhang , Tingdan Luo , Wei He , Wei Luan , Wei Yin , Wei Zhang , Wei Zhou , Weibao Gong , Weibin Li , Weicheng Huang , Weichong Dang , Weiguo Zhu , Weilong Zhang , Weiqi Tan , Wen Huang , Wenbin Chang , Wenjing Du , Wenlong Miao , Wenpei Luo , Wenquan Wu , Xi Shi , Xi Zhao , Xiang Gao , Xiangguo Zhang , Xiangrui Yu , Xiangsen Wang , Xiangzhe Wang , Xianlong Luo , Xianying Ma , Xiao Tan , Xiaocong Lin , Xiaofei Wang , Xiaofeng Peng , Xiaofeng Wu , Xiaojian Xu , Xiaolan Yuan , Xiaopeng Cui , Xiaotian Han , Xiaoxiong Liu , Xiaoxu Fei , Xiaoxuan Wu , Xiaoyu Wang , Xiaoyu Zhang , Xin Sun , Xin Wang , Xinhui Huang , Xinming Zhu , Xintong Yu , Xinyi Xu , Xinyu Wang , Xiuxian Li , XuanShi Zhu , Xue Xu , Xueying Lv , Xuhong Li , Xulong Wei , Xuyi Chen , Yabing Shi , Yafeng Wang , Yamei Li , Yan Liu , Yanfu Cheng , Yang Gao , Yang Liang , Yang Wang , Yang Wang , Yang Yang , Yanlong Liu , Yannian Fu , Yanpeng Wang , Yanzheng Lin , Yao Chen , Yaozong Shen , Yaqian Han , Yehua Yang , Yekun Chai , Yesong Wang , Yi Song , Yichen Zhang , Yifei Wang , Yifeng Guo , Yifeng Kou , Yilong Chen , Yilong Guo , Yiming Wang , Ying Chen , Ying Wang , Yingsheng Wu , Yingzhan Lin , Yinqi Yang , Yiran Xing , Yishu Lei , Yixiang Tu , Yiyan Chen , Yong Zhang , Yonghua Li , Yongqiang Ma , Yongxing Dai , Yongyue Zhang , Yu Ran , Yu Sun , Yu-Wen Michael Zhang , Yuang Liu , Yuanle Liu , Yuanyuan Zhou , Yubo Zhang , Yuchen Han , Yucheng Wang , Yude Gao , Yuedong Luo , Yuehu Dong , Yufeng Hu , Yuhui Cao , Yuhui Yun , Yukun Chen , Yukun Gao , Yukun Li , Yumeng Zhang , Yun Fan , Yun Ma , Yunfei Zhang , Yunshen Xie , Yuping Xu , Yuqin Zhang , Yuqing Liu , Yurui Li , Yuwen Wang , Yuxiang Lu , Zefeng Cai , Zelin Zhao , Zelun Zhang , Zenan Lin , Zezhao Dong , Zhaowu Pan , Zhaoyu Liu , Zhe Dong , Zhe Zhang , Zhen Zhang , Zhengfan Wu , Zhengrui Wei , Zhengsheng Ning , Zhenxing Li , Zhenyu Li , Zhenyu Qian , Zhenyun Li , Zhi Li , Zhichao Chen , Zhicheng Dong , Zhida Feng , Zhifan Feng , Zhihao Deng , Zhijin Yu , Zhiyang Chen , Zhonghui Zheng , Zhuangzhuang Guo , Zhujun Zhang , Zhuo Sun , Zichang Liu , Zihan Lin , Zihao Huang , Zihe Zhu , Ziheng Zhao , Ziping Chen , Zixuan Zhu , Ziyang Xu , Ziyi Liang , Ziyuan Gao

Different word embedding models capture different aspects of linguistic properties. This inspired us to propose a model (M-MaxLSTM-CNN) for employing multiple sets of word embeddings for evaluating sentence similarity/relation. Representing…

Computation and Language · Computer Science 2018-05-22 Huy Nguyen Tien , Minh Nguyen Le , Yamasaki Tomohiro , Izuha Tatsuya

While cross-lingual word embeddings have been studied extensively in recent years, the qualitative differences between the different algorithms remain vague. We observe that whether or not an algorithm uses a particular feature set…

Computation and Language · Computer Science 2017-01-11 Omer Levy , Anders Søgaard , Yoav Goldberg