<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Cloud on 风中飞舞</title><link>https://blog.perillaroc.wang/tags/cloud/</link><description>Recent content in Cloud on 风中飞舞</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Thu, 10 Sep 2026 21:19:51 +0800</lastBuildDate><atom:link href="https://blog.perillaroc.wang/tags/cloud/index.xml" rel="self" type="application/rss+xml"/><item><title>论文阅读：科学大数据的云原生存储库</title><link>https://blog.perillaroc.wang/post/2021/05/2021-05-20-paper-abernathey-2020-cloud-native-repositories/</link><pubDate>Sun, 23 May 2021 12:31:00 +0800</pubDate><guid>https://blog.perillaroc.wang/post/2021/05/2021-05-20-paper-abernathey-2020-cloud-native-repositories/</guid><description>&lt;p&gt;&lt;strong&gt;Cloud-Native Repositories for Big Scientific Data&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;&lt;p&gt;R. P. Abernathey et al., &amp;ldquo;Cloud-Native Repositories for Big Scientific Data,&amp;rdquo; in Computing in Science &amp;amp; Engineering, vol. 23, no. 2, pp. 26-35, 1 March-April 2021, doi: 10.1109/MCSE.2021.3059437.&lt;/p&gt;
&lt;/blockquote&gt;&lt;p&gt;一篇介绍云原生数据存储的文章，发表于 Computing in Science &amp;amp; Engineering。&lt;/p&gt;
&lt;h2 id="正文"&gt;正文&lt;/h2&gt;
&lt;h3 id="摘要"&gt;摘要&lt;/h3&gt;
&lt;p&gt;传统上，科学数据是通过从数据服务器下载到本地计算机来分发的。
随着科学数据集向 PB 级发展，这种工作方式受到了限制。&lt;/p&gt;
&lt;p&gt;本文定义的“云原生数据存储库”相对于传统数据存储库具有多个优势：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;性能&lt;/li&gt;
&lt;li&gt;可靠性&lt;/li&gt;
&lt;li&gt;成本效益&lt;/li&gt;
&lt;li&gt;协作&lt;/li&gt;
&lt;li&gt;可再现性&lt;/li&gt;
&lt;li&gt;创造力&lt;/li&gt;
&lt;li&gt;下游影响&lt;/li&gt;
&lt;li&gt;访问和包含 (access &amp;amp; inclusion)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;最佳实践&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这些目标激发了一组针对云原生数据存储库的最佳实践：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;分析就绪数据 (analysis-ready data)，云优化格式 (cloud-optimized formats)。统称 ARCO&lt;/li&gt;
&lt;li&gt;与数据邻近计算 (data-proximate computing) 的松散耦合&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Pangeo 项目通过使用开源科学 Python 工具开发了这些原则的原型实现。
通过提供 ARCO 数据目录以及按需、可扩展的分布式计算，Pangeo 使用户能够以超过 10 GB/s 的速率处理大数据。&lt;/p&gt;</description></item></channel></rss>