MIT 開放課程的 AI 學習路線(上):三條路線

社團提及會有三篇文章介紹 MIT 開放課程,第一篇是的整體介紹及使用方法。第二篇則是:如果你想學 AI,OCW 上該怎麼開始。

因為內容比較豐富,文章將分為上下集。上集介紹的是 AI 學習的三條路線,以及你學習前應具備哪些基礎。

先破除一個印象。很多人以為 OCW 的 AI 內容都是十幾年前的東西:Patrick Winston 那門經典的 6.034 是 2010 年的課,這印象不是憑空來的。但情況已經變了:2024 到 2025 年,OCW 上架了數門附完整課堂錄影的深度學習課程,內容涵蓋 transformer、大型語言模型、擴散模型。這些不是舊課重新包裝,是 MIT 現行課程的原始材料。

▌一、先確認你的基礎

這一節看起來很無聊,但跳過它的人有很高比例會在第三週放棄。

》程式

如果你沒寫過 Python,起點是 6.0001 Introduction to Computer Science and Programming in Python(Ana Bell、Eric Grimson、John Guttag 合授)。它明確設定給完全沒有程式經驗的人,是半學期的課,接著可以續修 6.0002 計算思維與資料科學

兩個必須先知道的限制:這是 2016 年的課,用的是 Python 3.5;而且官方明確說明習題沒有提供解答。前者影響不大(語法基礎沒變),後者對自學者是實質困擾,這件事在下篇會提出解決方法。

》數學

你無需修完一整套數學再開始,但兩塊東西遲早會擋住你:線性代數機率統計

參考點是 6.7960 深度學習這門課自己列的先修條件:學生應該先修過 18.05 機率統計導論,以及 6.3720、6.3900 機器學習導論、6.C01 三者之一。

翻譯成自學者的語言就是:線性代數+機率+一門機器學習入門,這是 MIT 認定的入場券。

線性代數可以直接用前一篇推薦的 18.06SC 線代課程。機器學習入門則有 6.036 Introduction to Machine Learning(2020 秋)。

但你不必全部修完才開始。 下面三條路線裡,有一條刻意繞開了大部分數學要求。

▌二、三條路線

學原理 動手做 讀論文
課程 6.7960 15.773 MAS.S60
開課 2024 秋 2024 春 2025 春
影片 OCW 無,課程官網有
數學要求
適合 想真的懂 想做得出來 想跟上研究

》路線 A:學習原理

6.7960 Deep Learning(2024 秋,Phillip Isola、Sara Beery、Jeremy Bernstein 合授)是 MIT 深度學習的主幹課程。

課程涵蓋神經網路架構(MLP、CNN、RNN、graph nets、transformers)、深度學習中的幾何與不變性、反向傳播與自動微分,並延伸到電腦視覺、自然語言處理與機器人等應用。

資源包含課堂錄影、講義、習題、指定閱讀,以及「Projects with Examples」——也就是附範例的專案作業,這對自學者格外重要,因為你有東西可以對照。部分習題附有解答。

兩個實話:第一,第 22 講沒有影片。第二,這門課的數學門檻是真的,它預設你修過機率統計和一門機器學習導論,講義裡甚至另附了一份數學符號說明。你可以硬看,但會很辛苦。

適合誰:想搞懂 attention 為什麼有效、想知道每個機制背後在算什麼、或打算往研究方向走的人。

》路線 B:動手實做

15.773 Hands-On Deep Learning(2024 春,Rama Ramakrishnan 教授)開在 Sloan 管理學院,這件事本身就說明了它的取向。

它的先修條件只要求:熟悉 Python,以及理解訓練/驗證/測試、過擬合/欠擬合、正則化這些基本機器學習概念。沒有硬性的數學門檻。

課程從零開始建構深度學習的組成元件,一路做到卷積網路、transformer、大型語言模型與擴散模型。舉的例子也很務實——怎麼偵測駕駛是不是快睡著了、怎麼摘要一通客服通話的內容。

資源清單是三條路線裡最完整的:講義、課堂錄影、習題、習題解答、程式作業,還有 Instructor Insights。而且課程本身就在 Colab 裡帶著做,你不需要自備顯示卡。

進度安排大致是:第 1 講神經網路導論、第 2 講訓練深度網路與反向傳播範例、第 3 講進入電腦視覺與從零建 CNN、第 9 與第 10 講大型語言模型、第 11 講影像生成的擴散模型。最後一天是學生專案報告,那堂沒有錄影。

適合誰:想在工作上真的用起來、不打算念博士的人。這是多數讀者選的路。

》路線 C:讀論文

MAS.S60 How to AI (Almost) Anything(2025 春,Paul Liang 教授)開在 Media Lab,是研究生課程。

它處理的問題是還沒有標準教科書的那一層。具體來說有兩塊:一是把基礎模型套用到非文字的資料型態:視覺、音訊、感測器訊號、醫療資料、音樂、藝術,甚至嗅覺與味覺;二是多模態系統怎麼把這些異質的來源表徵、融合與對齊。語言和影像大家都在做了,感測訊號和氣味沒有。

課程有相當比重的研究成分,期末是團隊研究專案。

提醒你三件事:

  • OCW 上的資源只有講義、指定閱讀與書面作業。課程自己的網站與 YouTube 有課堂錄影,例如第 8 講講的是多模態預訓練、多模態 transformer 與多模態大型語言模型。想看影片的人要去那裡找。

  • 這門課已經改版。 2026 年春季版更名為 MultiModal AI,把方法拆成六塊:異質資料的表徵與融合、跨視角對齊、多步推理、多模態內容生成、從高資源模態遷移到低資源模態,以及安全與人類對齊的量化。OCW 上放的仍是 2025 版,想看最新版要去課程官網。

  • 它真正的價值不在於「最新」,而在於它是一份有人替你編好的閱讀地圖。指定閱讀清單本身就是產品。

適合誰:已經有基礎、準備開始讀論文的人。如果你是初學者,這門課會讓你懷疑人生。

▌三、先別急著挑

三條路線攤開之後,正常的下一步是選一條開始看。

但在那之前,有一件更根本的事要先想清楚:你現在學這些東西的方式,和三年前應該不一樣。

因為現在你有 AI 可以用。實作類的知識:某個函式怎麼呼叫、某段程式怎麼寫…等,貶值的速度快到超乎想像。如果你還照著「看影片、抄程式、做作業」的老方法走完一門課,你花掉的時間有很大一部分是浪費的。

但這不代表課程沒用了。它代表課程的價值轉移了,而且轉移到一個更難、也更值錢的地方。

下篇會處理這件事,並給你四個檢查點,用來判斷自己是真的學會了,還是只是看完了。


▌參考資料