中文

SARS-CoV-2 冠状病毒数据压缩基准

数据库 2020-12-23 v1 计算机与社会

摘要

本文介绍了一项无损数据压缩竞赛,该竞赛以 44,981 条拼接的 SARS-CoV-2 序列的压缩大小作为基准来评测解决方案(计算机程序),其未压缩总大小为 1,339,868,341 字节。该数据于 2020 年 12 月 13 日从 ncbi.nlm.nih.gov 的严重急性呼吸综合征冠状病毒 2 数据中心下载,以 FASTA 和 2Bit 格式提供。本竞赛旨在鼓励多学科研究以找到该序列的最短无损描述,并证明数据压缩可作为跨学科学术突破的客观且可重复度量。数据的最短描述即最佳模型;因此,进一步减小该描述的大小需要对底层上下文和数据有根本性理解。本文给出了多种知名压缩算法的初步基线结果,并提供了有关有前景研究方向的见解。竞赛进展将在 \url{https://coronavirus.innar.com} 报告,且该基准向所有人开放参与和贡献。

关键词

引用

@article{arxiv.2012.12013,
  title  = {SARS-CoV-2 Coronavirus Data Compression Benchmark},
  author = {Innar Liiv},
  journal= {arXiv preprint arXiv:2012.12013},
  year   = {2020}
}

备注

6 pages, 2 tables