5分鐘了解數據儲存(電腦放資料的箱子)
Photo Credit: unsplash

5分鐘了解數據儲存(電腦放資料的箱子)

文/Jan-Willem Middelburg;譯/吳傑

為了開始理解數據分析的複雜性,重要的是要注意數據需要儲存在某個地方。 數據可以儲存在各種不同的位置,這取決於數據的類型和組織的需要。一些常見的儲存選項包括:

本地儲存

本地儲存(Local storage)是指在一個設備儲存數據,該設備的實體位置與用於存取數據的設備相同。這包括儲存在設備的硬碟、固態硬碟(solid-state drive, SSD)或設備內部的其他儲存媒介。

本地儲存的案例包括:
.儲存在個人電腦硬碟的數據
.儲存在筆記型電腦固態硬碟的數據
.儲存在移動設備內部儲存卡的數據
.儲存在設備所連接的USB硬碟或外部硬碟的數據

本地儲存可用於儲存範圍廣泛的數據,包括文字文件、圖像、影像、音樂和其他檔案。它還可以用於儲存應用程式、作業系統和其他軟體。本地儲存通常比遠程儲存更快、更可靠,但確實有一些限制,例如容量有限,如果設備損壞或被偷取,可能會造成損失。

雲端儲存

雲端儲存(Cloud storage)也是一種數據儲存,數據可以透過網際網路存取於遠端伺服器。這些伺服器由雲端儲存供應商維護和營運,例如 Amazon Web Services、Microsoft Azure和Google Cloud。雲端儲存允許使用者從任何具有網際網路連接的設備儲存和存取數據,使其成為一種高度可存取方便的選擇。

雲端儲存服務的案例包括:
.Amazon S3
.Microsoft Azure Storage
.Google Cloud Storage
.Dropbox
.iCloud

雲端儲存廣泛適用於各類數據,包括文字文件、圖像、影像、音樂和其他檔案。它還可以用於儲存應用程式、作業系統和其他軟體。雲端儲存通常比本地存儲更具可擴展性和可靠性,並且在容量和實體的可存取性,沒有相關的限制。

有兩種類型的雲端儲存:公有雲端儲存,數據儲存在與其他組織共享的基礎設施上;私有雲端儲存,數據儲存在只有特定組織才能存取的專用基礎設施上。

值得注意的是,雲端儲存還提供了數據備份、數據複製和災難恢復等附加功能,可以提高數據的可靠性和可用性。除此之外,許多雲端儲存供應商提供更深入的安全功能,例如加密,以確保數據受到保護和安全。

資料庫

資料庫(database)是以電子方式儲存和存取,有組織的數據集合。它的目的是對於大量數據提供高效且可靠的存取。資料庫可以被認為是一個電子檔案系統(electronic filing system),使用有組織和有效的方式儲存、檢索和更新數據。

有幾種類型的資料庫,包括:

1. 關聯式資料庫(Relational databases) – 關聯式資料庫將數據儲存在表格中,以行代表紀錄,列代表這些紀錄中的欄位。最流行的關聯式資料庫是MySQL、PostgreSQL 和Oracle。

2. 非關聯式資料庫(Non-relational databases) – 非關聯式資料庫,也稱為 NoSQL 資料庫,以非表格格式儲存數據,例如鍵值對(key-value pairs)、文件(documents)或圖形式數據。非關聯式資料庫的案例包括 MongoDB和Cassandra。

3. 常駐記憶體資料庫(In-memory databases) – 常駐記憶體資料庫將數據儲存在電腦的隨機存取記憶體 (random-access memory , RAM) 而不是硬碟上,這可以提高某些類型工作負載的性能,例如即時分析和高頻交易。

4. 時間序列資料庫(Time-series databases) – 時間序列資料庫針對儲存和查詢時間戳記(time-stamped)數據進行了優化,它們通常用於物聯網、監控和其他以高速率和時間戳記產生數據的應用程式。

資料庫用於儲存和管理各種應用程式中的數據,包括電子商務、金融、醫療保健和許多其他應用程式。它們使組織能夠有效地儲存、存取和分析大量數據,並為許多關鍵業務系統提供基礎。

請注意,資料庫可以存在於本地環境(即本地儲存),也可以存在於雲端環境中(即雲端儲存)。

資料倉庫

資料倉庫(data warehouse)是一個大規模、集中式的儲存資料庫,用於儲存和管理來自多個來源的數據。資料倉庫的目標是提供單一、整合的組織數據視圖(view of an organization’s data),使之可以更容易分析,並且做出明智決策的一種架構。

資料倉庫中的數據通常被組織成一個多維度(multidimensional)的模型,其中數據被分組為事實(facts)和維度(dimensions)。事實代表定量的數據(實際的數據),維度代表數據的特徵,如時間、地點、產品等(定義欄位的)。此數據模型允許快速靈活地查詢和進行數據的報告。

資料倉庫目的在處理大量數據,通常為TB或PB級。他們通常使用關聯式資料庫管理系統(RDBMS)並針對讀取繁重的工作負載進行了優化。

資料倉庫通常用於商業智慧、報告和分析。它們允許組織組合來自多種來源的數據,例如交易系統和外部數據,並以單一數據源無法實現的方式對其進行分析。

資料倉庫還提供數據的歷史視角,可用於趨勢分析、預測和決策制定。它們還允許整合來自不同系統的數據,並支持不同的數據類型和結構,可以用來支持不同的業務需求。

值得注意的是,隨著產生的數據量不斷增加,出現了一個稱為數據湖(Data Lake)的新概念,它允許利用原生的格式儲存原始的非結構化數據,從而促進大數據處理和分析。數據湖被認為是數據倉庫的一種更靈活、可擴展且更具成本效益的替代方案。

※ 本文摘自 《數據素養基礎》,原篇名為〈2.5 數據儲存〉,立即前往試讀►►►