顯示具有 機率與統計 標籤的文章。 顯示所有文章
顯示具有 機率與統計 標籤的文章。 顯示所有文章

使用統計在四小時內預測 Kickstarter 專案是否可以成功達成

統計學家發展出一個預測 Kickstarter 專案的模型,可在專案發起後的四小時預測該專案是否會成功。

Kickstarter

Kickstarter 是一個專為群眾集資而設計的仲介網站,專案的發起人可以提出一些有創意的專案,經過 Kickstarter 審核之後放上的網頁,向全世界的人募集資金來進行自己想實作的專案,若在一定的期限之內該專案所募集到的資金達到最低的門檻值,則該 Kickstarter 專案就算是成功了。

史丹佛大學機器學習(Machine Learning)上課筆記(五)

本篇為史丹佛大學機器學習(Machine Learning)課程 Lecture 4 的前半段筆記,接續 Lecture 3 的內容。

史丹佛大學 Logo

這是 Lecture 4 的線上課程錄影:

史丹佛大學機器學習(Machine Learning)上課筆記(四)

本篇為史丹佛大學機器學習(Machine Learning)課程 Lecture 3 的後半段筆記,接續 Lecture 3 前半部的內容。

史丹佛大學 Logo

這是 Lecture 3 的線上課程錄影:

史丹佛大學機器學習(Machine Learning)上課筆記(三)

本篇為史丹佛大學機器學習(Machine Learning)課程 Lecture 3 的前半段筆記,接續 Lecture 2 的內容。

史丹佛大學 Logo

這是 Lecture 3 的線上課程錄影:


這裡老師上課的順序跟 Lecture note 上的不太一樣,我整理的時候都是按照 Lecture note 上的順序,再加上一些老師上課補充的部分,但基本上內容都是相同的。

以統計分析與預測技術降低犯罪率:靠著有效佈署警力,達到預防犯罪

IBM 以一套分析與預測軟體,協助美國警方打擊犯罪,自從 2006 年以來讓嚴重型犯罪降低 30%,其中包含 15% 的暴力犯罪。


靠著這套軟體,美國警方(例如曼非斯警局,Memphis Police Department)可以評估整個城市的事故模式(incident patterns),然後預測犯罪的熱點(hot spots),調配警力至高犯罪機率的地點,藉此有效降低犯罪事件的發生。下面這段影片是 IBM 的一段廣告,描述了這個概念。


影片的氣氛營造得很棒,也傳達了該傳達的概念,不過真實情況應該沒有那麼神奇。 :)

資料科學家(Data Scientist)的價值所在:美國遊說活動資料實例分析

這裡用一個美國遊說活動的資料為例,說明資料科學家(Data Scientist)到底在做什麼。

上個月的 Data Science DC Meetup 會議中,一些來自 Sunlight Foundation 的研究者報告了一些使用進階資料分析與視覺化的方法,使一般的文字資料更容易讓人理解。

其中有一些資料是關於美國遊說活動(lobbying activities)的開放性原始資料,而任何人也都可以在遵守 FOIA(Freedom of Information Act)條款下取得這些資料,但是這些資料如果沒有經過整理,你可能很難完全消化,因為這個原始資料沒有特定的結構,都是一般的文字報告,就像這樣:

Lobbying ReportLobbying Report

如果只有幾份報告,那是沒什麼問題,但是現在這種報告有 7814 份,包含 987 個法案、678 個機構、170 種行業,這些報告都是近年來(2007 年至 2012 年)跟移民法案(immigration bills)相關的遊說報告,我們有興趣的是有沒有什麼資訊隱藏在這將近八千份的文件中,因為沒有人有辦法一次看完將近八千份文件,所以我們會需要一些資料科學家來幫忙做分析。

史丹佛大學機器學習(Machine Learning)上課筆記(二)

史丹佛大學 Logo
本篇為史丹佛大學機器學習(Machine Learning)課程 Lecture 2 的後半段筆記,其接續上半段的內容。

The Normal Equations

要找 \(J\) 的最小值除了 gradient descent 演算法之外,還有許多方式,這裡介紹另一個方法,使用這個方法直接使用 explict 的方式算出最小值,這樣可以不需要使用遞迴的方式。

在這個方法中,我們直接把 \(J\) 對每個 \(\theta_j\) 做微分,然後將其設定為零,為了簡化代數的推導,我們先介紹一些微積分的矩陣表示法。

史丹佛大學機器學習(Machine Learning)上課筆記(一)

這是我觀看史丹佛大學機器學習(Machine Learning)課程時,自己做的筆記,分享給大家。本篇為 Lecture 2 的前半段筆記。

史丹佛大學 Logo

這是史丹佛大學機器學習課程 Lecture 2 的錄影,而英文的 Lecture notes 可以從他的官方網站下載。

如何成為一位資料科學家(Data Scientist)?處理 Big Data 的專家

這裡整理了一張如何成為資料科學家(Data Scientist)的行程規劃圖,其中包含各種領域以及其中主要的技術,如果你想研究這方面的技術,這張圖就很值得的你參考。

在資訊爆炸的時代隨著的資料量的增加,如何處理與分析這些資料是一個前所未有的問題,要做一個稱職的資料科學家不是件容易的事情,他牽涉到各種不同的領域,從基本簡單的數學理論、大量資料、程式設計到統計、機器學習與資料視覺化等等,要能夠熟練這些領域的技巧不是一朝一夕能夠達成的。

以下這張圖是由 Swami Chandrasekaran 所繪製的,他將一般資料科學家應該具備的能力整理成一張捷運地圖。

如何成為一位資料科學家(Data Scientist)