史丹佛大學機器學習(Machine Learning)上課筆記(三)
本篇為史丹佛大學機器學習(Machine Learning)課程 Lecture 3 的前半段筆記,接續 Lecture 2 的內容。
這是 Lecture 3 的線上課程錄影:
這裡老師上課的順序跟 Lecture note 上的不太一樣,我整理的時候都是按照 Lecture note 上的順序,再加上一些老師上課補充的部分,但基本上內容都是相同的。
這是 Lecture 3 的線上課程錄影:
這裡老師上課的順序跟 Lecture note 上的不太一樣,我整理的時候都是按照 Lecture note 上的順序,再加上一些老師上課補充的部分,但基本上內容都是相同的。
資料科學家(Data Scientist)的價值所在:美國遊說活動資料實例分析
這裡用一個美國遊說活動的資料為例,說明資料科學家(Data Scientist)到底在做什麼。
上個月的 Data Science DC Meetup 會議中,一些來自 Sunlight Foundation 的研究者報告了一些使用進階資料分析與視覺化的方法,使一般的文字資料更容易讓人理解。
其中有一些資料是關於美國遊說活動(lobbying activities)的開放性原始資料,而任何人也都可以在遵守 FOIA(Freedom of Information Act)條款下取得這些資料,但是這些資料如果沒有經過整理,你可能很難完全消化,因為這個原始資料沒有特定的結構,都是一般的文字報告,就像這樣:
如果只有幾份報告,那是沒什麼問題,但是現在這種報告有 7814 份,包含 987 個法案、678 個機構、170 種行業,這些報告都是近年來(2007 年至 2012 年)跟移民法案(immigration bills)相關的遊說報告,我們有興趣的是有沒有什麼資訊隱藏在這將近八千份的文件中,因為沒有人有辦法一次看完將近八千份文件,所以我們會需要一些資料科學家來幫忙做分析。
上個月的 Data Science DC Meetup 會議中,一些來自 Sunlight Foundation 的研究者報告了一些使用進階資料分析與視覺化的方法,使一般的文字資料更容易讓人理解。
其中有一些資料是關於美國遊說活動(lobbying activities)的開放性原始資料,而任何人也都可以在遵守 FOIA(Freedom of Information Act)條款下取得這些資料,但是這些資料如果沒有經過整理,你可能很難完全消化,因為這個原始資料沒有特定的結構,都是一般的文字報告,就像這樣:
如果只有幾份報告,那是沒什麼問題,但是現在這種報告有 7814 份,包含 987 個法案、678 個機構、170 種行業,這些報告都是近年來(2007 年至 2012 年)跟移民法案(immigration bills)相關的遊說報告,我們有興趣的是有沒有什麼資訊隱藏在這將近八千份的文件中,因為沒有人有辦法一次看完將近八千份文件,所以我們會需要一些資料科學家來幫忙做分析。
史丹佛大學機器學習(Machine Learning)上課筆記(二)
本篇為史丹佛大學機器學習(Machine Learning)課程 Lecture 2 的後半段筆記,其接續上半段的內容。
在這個方法中,我們直接把 \(J\) 對每個 \(\theta_j\) 做微分,然後將其設定為零,為了簡化代數的推導,我們先介紹一些微積分的矩陣表示法。
The Normal Equations
要找 \(J\) 的最小值除了 gradient descent 演算法之外,還有許多方式,這裡介紹另一個方法,使用這個方法直接使用 explict 的方式算出最小值,這樣可以不需要使用遞迴的方式。在這個方法中,我們直接把 \(J\) 對每個 \(\theta_j\) 做微分,然後將其設定為零,為了簡化代數的推導,我們先介紹一些微積分的矩陣表示法。
史丹佛大學機器學習(Machine Learning)上課筆記(一)
這是我觀看史丹佛大學機器學習(Machine Learning)課程時,自己做的筆記,分享給大家。本篇為 Lecture 2 的前半段筆記。
這是史丹佛大學機器學習課程 Lecture 2 的錄影,而英文的 Lecture notes 可以從他的官方網站下載。
這是史丹佛大學機器學習課程 Lecture 2 的錄影,而英文的 Lecture notes 可以從他的官方網站下載。
訂閱:
文章 (Atom)





