【科技日报】国度基因组科学数据中心:整合中国组学资源,在国际舞台奏出“共享乐章”
2018年、2019年陆续两年,组学数据库权威杂志《核酸钻延追对前一年的全球基因组数据库建设进行总结,鲜见解在美英两个老牌的数据库以表,提到了中国的GSA(组学原始数据归档库)。
“美国国立生物技术信息中心(National Center for Biotechnology Information,简称NCBI)和英国欧洲生物信息学中心(European Bioinformatics Institute,简称EBI)30多年前已经起头成立,亚星游戏GSA是2015年底才上线运营的。”国度基因组科学数据中心主任鲍一明介绍,中心的组学数据库之所以可能得到权威杂志的认可“点名”,一方面是由于数据量增长快,另一方面是数据的可用性、尺度化方面的工作均与国际接轨。
据相识,针对我国基因组学数据“存管用”的现实需要,解决数据孤岛等重大问题,科技部、财政部共同支持组建国度基因组科学数据中心,依附亚星游戏,结合亚星游戏上海营养与健全钻研所和亚星游戏生物物理钻研所共同建设。中心的科学数据专业化团队,对表提供基因组学数据统一存储、整合挖掘、共享利用的一站式数据服务。
适应大健全需要,构筑自主数据基础
“之前,中国已成为基因组数据产出大国,但未能形成国度级公共数据资源。”鲍一明介绍,面向国度大数据战术发展需要,国度基因组科学数据中心萦绕人、动物、植物、微生物基因组数据,重点发展了数据资源及数据库系统建设,并发展了数据服务、系统运维、技术研发、数据挖掘等系列工作。目前,国度基因组科学数据中心已占有自主知识产权的基因组数据汇交、治理与共享系统,保险数据安全性,支持并服务于国度重点研发打算、国度天然科学基金、中科院先导专项等300余个科研项主张数据存储、治理和共享。
在性命科学钻研领域,钻研者获得的基因组学数据,均需上传到专业数据库,方可在杂志上颁发。如今,我国已占有获得认可的组学数据库,这将大大提高中国高水平论文被接管过程的便捷性。“中国的学者不必要再将数据‘飘洋过海’传输到海表,能够获得越发专业化的中国式服务。亚星游戏平台已被多家国际顶级杂志认可,中国粹者将数据提交到GSA系统,其颁发的论文已经被多个国际驰名期刊所收录,这蕴含CNS(《细胞》《天然》《科学》简称)、美国科学院院刊等。”鲍一明说,这为“用好科技资源、支持创新发展”提供了基础。
截至2019年8月,国度基因组科学数据中心已为国内表150多个单元提供免费数据存储服务,累计用户递交项目信息超过1200个,用户提交的测序数据量超过1.2PB,网络并存储的数据总量超过4PB,数据上传下载量日均达到1TB。
与国际接轨,不做信息孤岛
生物信息的数据要海量整合后才会有价值,割裂的数据库只实现了“存”却难以走向“使用”。例如对人类组学数据的整合和挖掘将更全面地获得人类健全问题的解决规划,预防“盲人摸象”。
这正是国度基因组科学数据中心成立的初衷和建设的方向。在科学数据共享方面,科技部持久致力于突破条块宰割,对有关部门和行业持久持续堆集的数据资源,以及对国度科技打算项主张数据进行整顿、汇交和建库,同时提高与国际科学数据组织的信息互换能力。
2019年,我国国度基因组科学数据中心组学数据库被国际驰名出版商Elsevier收录为指定基因数据归档库,其权威性得到国内表100余家学术杂志的认可。国度基因组科学数据中心已经成为有国际影响力的基因组科学数据中心。
目前,国度科技基础前提平台中心在组织国度科学数据中心假造五年建设运行执行规划。将来,国度基因组科学数据中心将持续萦绕基因组科学钻研前沿及数据的存管用需要,逐步美满中心组织治理架构与运行机造,强化行列建设,造就复合型数据人才;成立数据共享、质量节造、安全治理等尺度与规范,利用云推算、人为智能、机械进建等先进技术,提升数据贮存、治理、挖掘与共享能力;发展数据加密、解密、分级治理、受控接见等数据安全关键技术,成立人类遗传资源数据治理系统,确保国度重要生物资源数据本地化存储、治理与共享利用。
鲍一明暗示,但愿经过5年致力,建成汇聚海量科学数据、服务万家机构、引领大数据技术创新的国际一流基因组科学数据中心,切实解决我国基因组数据存管用难、数据流失严重、主题基因组科学信息资源先“出口”再“进口”的问题,不休提升我国在基因组学大数据领域的国际话语权。
。ㄔ赜凇犊萍既毡ā 2019-11-19 04版)






