當前位置:編程學習大全網 - 源碼破解 - Hadoop到底是什麽玩意

Hadoop到底是什麽玩意

Hadoop到底是個啥?

答:Hadoop是基於廉價設備利用集群的威力對海量數據進行安全存儲和高效計算的分布式存儲和分析框架,Hadoop本身是壹個龐大的項目家族,其核心 家族或者底層是HDFS和MapReduce,HDFS和MapReduce分別用來實現對海量數據的存儲和分析,其它的項目,例如Hive、HBase 等都是基於HDFS和MapReduce,是為了解決特定類型的大數據處理問題而提出的子項目,使用Hive、HBase等子項目可以在更高的抽象的基礎上更簡單的編寫分布式大數據處理程序。Hadoop的其它子項目還包括Common, Avro, Pig, ZooKeeper, Sqoop, Oozie 等,隨著時間的推移壹些新的子項目會被加入進來,壹些關註度不高的項目會被移除Hadoop家族,所以Hadoop是壹個充滿活力的系統。

Apache Hadoop: 是Apache開源組織的壹個分布式計算開源框架,提供了壹個分布式文件系統子項目(HDFS)和支持MapReduce分布式計算的軟件架構。

Apache Hive: 是基於Hadoop的壹個數據倉庫工具,可以將結構化的數據文件映射為壹張數據庫表,通過類SQL語句快速實現簡單的MapReduce統計,不必開發專門的MapReduce應用,十分適合數據倉庫的統計分析。

ApachePig: 是壹個基於Hadoop的大規模數據分析工具,它提供的SQL-LIKE語言叫Pig Latin,該語言的編譯器會把類SQL的數據分析請求轉換為壹系列經過優化處理的MapReduce運算。

ApacheHBase: 是壹個高可靠性、高性能、面向列、可伸縮的分布式存儲系統,利用HBase技術可在廉價PC Server上搭建起大規模結構化存儲集群。

Apache Sqoop: 是壹個用來將Hadoop和關系型數據庫中的數據相互轉移的工具,可以將壹個關系型數據庫(MySQL ,Oracle ,Postgres等)中的數據導進到Hadoop的HDFS中,也可以將HDFS的數據導進到關系型數據庫中。

Apache Zookeeper: 是壹個為分布式應用所設計的分布的、開源的協調服務,它主要是用來解決分布式應用中經常遇到的壹些數據管理問題,簡化分布式應用協調及其管理的難度,提供高性能的分布式服務 ApacheMahout:是基於Hadoop的機器學習和數據挖掘的壹個分布式框架。Mahout用MapReduce實現了部分數據挖掘算法,解決了並行挖掘的問題。

ApacheCassandra:是壹套開源分布式NoSQL數據庫系統。它最初由Facebook開發,用於儲存簡單格式數據,集Google BigTable的數據模型與AmazonDynamo的完全分布式的架構於壹身 Apache Avro: 是壹個數據序列化系統,設計用於支持數據密集型,大批量數據交換的應用。Avro是新的數據序列化格式與傳輸工具,將逐步取代Hadoop原有的IPC機制 ApacheAmbari: 是壹種基於Web的工具,支持Hadoop集群的供應、管理和監控。

ApacheChukwa: 是壹個開源的用於監控大型分布式系統的數據收集系統,它可以將各種各樣類型的數據收集成適合 Hadoop 處理的文件保存在 HDFS 中供Hadoop 進行各種 MapReduce 操作。

ApacheHama: 是壹個基於HDFS的BSP(Bulk Synchronous Parallel)並行計算框架, Hama可用於包括圖、矩陣和網絡算法在內的大規模、大數據計算。

ApacheFlume: 是壹個分布的、可靠的、高可用的海量日誌聚合的系統,可用於日誌數據收集,日誌數據處理,日誌數據傳輸。

ApacheGiraph: 是壹個可伸縮的分布式叠代圖處理系統, 基於Hadoop平臺,靈感來自 BSP (bulk synchronous parallel) 和Google 的 Pregel。

ApacheOozie: 是壹個工作流引擎服務器, 用於管理和協調運行在Hadoop平臺上(HDFS、Pig和MapReduce)的任務。

ApacheCrunch: 是基於Google的FlumeJava庫編寫的Java庫,用於創建MapReduce程序。與Hive,Pig類似,Crunch提供了用於實現如連接數據、執行聚合和排序記錄等常見任務的模式庫 ApacheWhirr: 是壹套運行於雲服務的類庫(包括Hadoop),可提供高度的互補性。Whirr學支持Amazon EC2和Rackspace的服務。

ApacheBigtop: 是壹個對Hadoop及其周邊生態進行打包,分發和測試的工具。

ApacheHCatalog: 是基於Hadoop的數據表和存儲管理,實現中央的元數據和模式管理,跨越Hadoop和RDBMS,利用Pig和Hive提供關系視圖。

ClouderaHue: 是壹個基於WEB的監控和管理系統,實現對HDFS,MapReduce/YARN, HBase, Hive, Pig的web化操作和管理。

  • 上一篇:廣場舞大風吹過無邊的草原
  • 下一篇:急診室故事第二季的觀後感1000字
  • copyright 2024編程學習大全網