社團提及會有三篇文章介紹 MIT 開放課程,第一篇是的整體介紹及使用方法。第二篇則是:如果你想學 AI,OCW 上該怎麼開始。
因為內容比較豐富,文章將分為上下集。上集介紹的是 AI 學習的三條路線,以及你學習前應具備哪些基礎。
先破除一個印象。很多人以為 OCW 的 AI 內容都是十幾年前的東西:Patrick Winston 那門經典的 6.034 是 2010 年的課,這印象不是憑空來的。但情況已經變了:2024 到 2025 年,OCW 上架了數門附完整課堂錄影的深度學習課程,內容涵蓋 transformer、大型語言模型、擴散模型。這些不是舊課重新包裝,是 MIT 現行課程的原始材料。
▌一、先確認你的基礎
這一節看起來很無聊,但跳過它的人有很高比例會在第三週放棄。
》程式
如果你沒寫過 Python,起點是 6.0001 Introduction to Computer Science and Programming in Python(Ana Bell、Eric Grimson、John Guttag 合授)。它明確設定給完全沒有程式經驗的人,是半學期的課,接著可以續修 6.0002 計算思維與資料科學。
兩個必須先知道的限制:這是 2016 年的課,用的是 Python 3.5;而且官方明確說明習題沒有提供解答。前者影響不大(語法基礎沒變),後者對自學者是實質困擾,這件事在下篇會提出解決方法。
》數學
你無需修完一整套數學再開始,但兩塊東西遲早會擋住你:線性代數 和 機率統計。
參考點是 6.7960 深度學習這門課自己列的先修條件:學生應該先修過 18.05 機率統計導論,以及 6.3720、6.3900 機器學習導論、6.C01 三者之一。
翻譯成自學者的語言就是:線性代數+機率+一門機器學習入門,這是 MIT 認定的入場券。
線性代數可以直接用前一篇推薦的 18.06SC 線代課程。機器學習入門則有 6.036 Introduction to Machine Learning(2020 秋)。
但你不必全部修完才開始。 下面三條路線裡,有一條刻意繞開了大部分數學要求。
▌二、三條路線
| 學原理 | 動手做 | 讀論文 | |
|---|---|---|---|
| 課程 | 6.7960 | 15.773 | MAS.S60 |
| 開課 | 2024 秋 | 2024 春 | 2025 春 |
| 影片 | 有 | 有 | OCW 無,課程官網有 |
| 數學要求 | 高 | 低 | 中 |
| 適合 | 想真的懂 | 想做得出來 | 想跟上研究 |
》路線 A:學習原理
6.7960 Deep Learning(2024 秋,Phillip Isola、Sara Beery、Jeremy Bernstein 合授)是 MIT 深度學習的主幹課程。
課程涵蓋神經網路架構(MLP、CNN、RNN、graph nets、transformers)、深度學習中的幾何與不變性、反向傳播與自動微分,並延伸到電腦視覺、自然語言處理與機器人等應用。
資源包含課堂錄影、講義、習題、指定閱讀,以及「Projects with Examples」——也就是附範例的專案作業,這對自學者格外重要,因為你有東西可以對照。部分習題附有解答。
兩個實話:第一,第 22 講沒有影片。第二,這門課的數學門檻是真的,它預設你修過機率統計和一門機器學習導論,講義裡甚至另附了一份數學符號說明。你可以硬看,但會很辛苦。
適合誰:想搞懂 attention 為什麼有效、想知道每個機制背後在算什麼、或打算往研究方向走的人。
》路線 B:動手實做
15.773 Hands-On Deep Learning(2024 春,Rama Ramakrishnan 教授)開在 Sloan 管理學院,這件事本身就說明了它的取向。
它的先修條件只要求:熟悉 Python,以及理解訓練/驗證/測試、過擬合/欠擬合、正則化這些基本機器學習概念。沒有硬性的數學門檻。
課程從零開始建構深度學習的組成元件,一路做到卷積網路、transformer、大型語言模型與擴散模型。舉的例子也很務實——怎麼偵測駕駛是不是快睡著了、怎麼摘要一通客服通話的內容。
資源清單是三條路線裡最完整的:講義、課堂錄影、習題、習題解答、程式作業,還有 Instructor Insights。而且課程本身就在 Colab 裡帶著做,你不需要自備顯示卡。
進度安排大致是:第 1 講神經網路導論、第 2 講訓練深度網路與反向傳播範例、第 3 講進入電腦視覺與從零建 CNN、第 9 與第 10 講大型語言模型、第 11 講影像生成的擴散模型。最後一天是學生專案報告,那堂沒有錄影。
適合誰:想在工作上真的用起來、不打算念博士的人。這是多數讀者選的路。
》路線 C:讀論文
MAS.S60 How to AI (Almost) Anything(2025 春,Paul Liang 教授)開在 Media Lab,是研究生課程。
它處理的問題是還沒有標準教科書的那一層。具體來說有兩塊:一是把基礎模型套用到非文字的資料型態:視覺、音訊、感測器訊號、醫療資料、音樂、藝術,甚至嗅覺與味覺;二是多模態系統怎麼把這些異質的來源表徵、融合與對齊。語言和影像大家都在做了,感測訊號和氣味沒有。
課程有相當比重的研究成分,期末是團隊研究專案。
提醒你三件事:
-
OCW 上的資源只有講義、指定閱讀與書面作業。 但課程自己的網站與 YouTube 有課堂錄影,例如第 8 講講的是多模態預訓練、多模態 transformer 與多模態大型語言模型。想看影片的人要去那裡找。
-
這門課已經改版。 2026 年春季版更名為 MultiModal AI,把方法拆成六塊:異質資料的表徵與融合、跨視角對齊、多步推理、多模態內容生成、從高資源模態遷移到低資源模態,以及安全與人類對齊的量化。OCW 上放的仍是 2025 版,想看最新版要去課程官網。
-
它真正的價值不在於「最新」,而在於它是一份有人替你編好的閱讀地圖。指定閱讀清單本身就是產品。
適合誰:已經有基礎、準備開始讀論文的人。如果你是初學者,這門課會讓你懷疑人生。
▌三、先別急著挑
三條路線攤開之後,正常的下一步是選一條開始看。
但在那之前,有一件更根本的事要先想清楚:你現在學這些東西的方式,和三年前應該不一樣。
因為現在你有 AI 可以用。實作類的知識:某個函式怎麼呼叫、某段程式怎麼寫…等,貶值的速度快到超乎想像。如果你還照著「看影片、抄程式、做作業」的老方法走完一門課,你花掉的時間有很大一部分是浪費的。
但這不代表課程沒用了。它代表課程的價值轉移了,而且轉移到一個更難、也更值錢的地方。
下篇會處理這件事,並給你四個檢查點,用來判斷自己是真的學會了,還是只是看完了。