[Hive/HBase] 如何串接 Hive/HBase 資料庫

一般來說在視覺化資料庫的方法一般來說如果是 Hive 資料庫可以透過 DBeaver 等等類似 SQL Client 的程式來顯現,但是如果是像是 HBase 的資料庫的話基本上很難快速了解 HBase 裡面存取的檔案全貌,如果可以利用 Hive 用表格的方式呈現的話會比較好理解,本篇想要介紹如何將 HBase 利用 Hive 呈現出來!

詳細內容

[統計] 為什麼樣本標準差要除以 n-1 ?

本篇想要簡單的紀錄並且回答一個學習統計的人會遇到的問題,其實有不少統計的老師有討論過這個問題例如連結,但是並不是經過一個比較嚴謹的數學推導,本篇取材的來源是由 Michael J. Evans and Jeffrey S.Rosenthal 著作的機率與統計,不確定性的科學一書,點擊即可以下載。

詳細內容

[Arrêt Travail] Garde d’enfant 兒童照顧假

因應新冠肺炎的疫情,法國於 2020/03/17 號開始進行限制移動的政策措施,詳情見連結。更早之前於 3/16 號開始所有學校與托兒所都已經關閉,這造成很多家長面臨小孩子在家沒有人照顧的困境。從 3/16 號開始,法國政府出台小孩照顧假 (Arrêt travail pour garder d’enfant) 讓爸媽可以停止上班去照顧小孩!本篇想要紀錄這一個措施詳細的實行細節與內容!本篇參考發布的內容!

詳細內容

[Spark] Row: getList() 的隱藏錯誤

在開發 Java Spark 的時候,常常會需要轉換 Dataset 或是 DataFrame,對於比較大的表格格式變換 (Schema Change),通常會使用到 JavaRDD 與 Row,開發時用到比較複雜的資料結構像是 List 或是 Map 等等的時候,有時候發生錯誤並不知道要如何除錯?本篇想要展示類別 Row: getList() 的隱藏錯誤在使用的時候發生無法理解的 NullPointerException 現象並且其解決的方法!

詳細內容

[Oozie] Continuous Delivery with Oozie

在大數據的平台上開發大數據應用的時候,如果想要自動化執行不同的 Spark 腳本的話,很常會使用 Apache Oozie 這個軟體,如果想要配合一些 Continuous Delivery 的工具如 Jenkins 和 TeamCity 來使用的時候,需要透過 Oozie 的 WebAPI 來使用,有兩種主要的使用方法,一種是利用 Shell Script 下達 Curl 的指令快速溝通,另一種方式則是利用 Oozie 專案開發的 OozieClient 配合 groovy 或是 Java 的指令運行。

詳細內容