中文

PreCogIIITH 在 HinglishEval 上的工作:利用码混合度量与语言模型嵌入估计码混合质量

人工智能 2022-06-17 v1

摘要

码混合是在一个言语事件中混合两种或更多语言的现象,且在多语社会中普遍存在。鉴于码混合的低资源性质,机器生成码混合文本是一种普遍的数据增强方法。然而,评估此类机器生成码混合文本的质量是一个开放问题。在我们提交给 HinglishEval(与 INLG2022 联合举办的共享任务)的工作中,我们尝试通过预测码混合质量的评分,构建影响合成生成码混合文本质量的因素的模型。

关键词

引用

@article{arxiv.2206.07988,
  title  = {PreCogIIITH at HinglishEval : Leveraging Code-Mixing Metrics & Language Model Embeddings To Estimate Code-Mix Quality},
  author = {Prashant Kodali and Tanmay Sachan and Akshay Goindani and Anmol Goel and Naman Ahuja and Manish Shrivastava and Ponnurangam Kumaraguru},
  journal= {arXiv preprint arXiv:2206.07988},
  year   = {2022}
}