文章內容

講述大數據靈丹妙藥之Hadoop的前世今生

發布時間: 2012/9/5 10:43:54

一個分布式系統基礎架構，由Apache基金會開發。用戶可以在不了解分布式底層細節的情況下，開發分布式程序。充分利用集群的威力高速運算和存儲。Hadoop實現了一個分布式文件系統（Hadoop Distributed File System），簡稱HDFS。HDFS有著高容錯性的特點，并且設計用來部署在低廉的（low-cost）硬件上。而且它提供高傳輸率（high throughput）來訪問應用程序的數據，適合那些有著超大數據集（large data set）的應用程序。HDFS放寬了（relax）POSIX的要求（requirements）這樣可以流的形式訪問（streaming access）文件系統中的數據。

　　Hadoop名字的起源

　　Hadoop這個名字不是一個縮寫，它是一個虛構的名字。該項目的創建者，Doug Cutting如此解釋Hadoop的得名：“這個名字是我孩子給一個棕黃色的大象樣子的填充玩具命名的。我的命名標準就是簡短，容易發音和拼寫，沒有太多的意義，并且不會被用于別處。小孩子是這方面的高手。”[Hadoop： The Definitive Guide]

　　Hadoop 由 Apache Software Foundation 公司于 2005 年秋天作為 Lucene的子 hadoop logo

　　項目 Nutch的一部分正式引入。它受到最先由 Google Lab 開發的 Map/Reduce 和 Google File System(GFS) 的啟發。2006 年 3 月份，Map/Reduce 和 Nutch Distributed File System (NDFS) 分別被納入稱為 Hadoop 的項目中。

　　Hadoop 是最受歡迎的在 Internet 上對搜索關鍵字進行內容分類的工具，但它也可以解決許多要求極大伸縮性的問題。例如，如果您要 grep 一個 10TB 的巨型文件，會出現什么情況？在傳統的系統上，這將需要很長的時間。但是 Hadoop 在設計時就考慮到這些問題，采用并行執行機制，因此能大大提高效率。

　　hadoop優點

　　Hadoop 是一個能夠對大量數據進行分布式處理的軟件框架。但是 Hadoop 是以一種可靠、高效、可伸縮的方式進行處理的。Hadoop 是可靠的，因為它假設計算元素和存儲會失敗，因此它維護多個工作數據副本，確保能夠針對失敗的節點重新分布處理。Hadoop 是高效的，因為它以并行的方式工作，通過并行處理加快處理速度。Hadoop 還是可伸縮的，能夠處理 PB 級數據。此外，Hadoop 依賴于社區服務器，因此它的成本比較低，任何人都可以使用。

　　Hadoop帶有用 Java 語言編寫的框架，因此運行在 Linux 生產平臺上是非常理想的。Hadoop 上的應用程序也可以使用其他語言編寫，比如 C++。

本文出自：億恩科技【www.laynepeng.cn】

服務器租用/服務器托管中國五強！虛擬主機域名注冊頂級提供商！15年品質保障！--億恩科技[ENKJ.COM]