# 用免費開源的 OpenAI Whisper 語音轉文字，自動產生影片字幕檔

**URL:** https://vip.studycamp.tw/t/%E7%94%A8%E5%85%8D%E8%B2%BB%E9%96%8B%E6%BA%90%E7%9A%84-openai-whisper-%E8%AA%9E%E9%9F%B3%E8%BD%89%E6%96%87%E5%AD%97%EF%BC%8C%E8%87%AA%E5%8B%95%E7%94%A2%E7%94%9F%E5%BD%B1%E7%89%87%E5%AD%97%E5%B9%95%E6%AA%94/7804
**Category:** 學習輔助軟體／工具
**Created:** [2025年一月9日 10:58 UTC](https://vip.studycamp.tw/t/%E7%94%A8%E5%85%8D%E8%B2%BB%E9%96%8B%E6%BA%90%E7%9A%84-openai-whisper-%E8%AA%9E%E9%9F%B3%E8%BD%89%E6%96%87%E5%AD%97%EF%BC%8C%E8%87%AA%E5%8B%95%E7%94%A2%E7%94%9F%E5%BD%B1%E7%89%87%E5%AD%97%E5%B9%95%E6%AA%94/7804 "2025-01-09T10:58:19Z")
**Posts on this page:** 1
**Page:** 1

<div class="post-metadata">

### Author: ![sky](https://vip.studycamp.tw/user_avatar/vip.studycamp.tw/sky/32/8098_2.png) [@sky](https://vip.studycamp.tw/u/sky)
#### Post date: [2025年一月9日 10:58 UTC](https://vip.studycamp.tw/t/%E7%94%A8%E5%85%8D%E8%B2%BB%E9%96%8B%E6%BA%90%E7%9A%84-openai-whisper-%E8%AA%9E%E9%9F%B3%E8%BD%89%E6%96%87%E5%AD%97%EF%BC%8C%E8%87%AA%E5%8B%95%E7%94%A2%E7%94%9F%E5%BD%B1%E7%89%87%E5%AD%97%E5%B9%95%E6%AA%94/7804/1 "2025-01-09T10:58:19Z")

</div>

本文主要摘錄自參考資料中的 YouTube 影片，以下是驗證過的執行步驟。

## ▌1. [安裝 Python](https://www.python.org/downloads/release/python-3119/)

> 重要提示：**[Whisper Github](https://github.com/openai/whisper)** 中提及，Whisper 與 Python 3.8~3.11 相容， **建議安裝較新的 3.11** 。
> 
> 3.11.10 和 3.11.11 都是增加安全性，沒有單獨安裝檔，所以先安裝 **[3.11.09](https://www.python.org/downloads/release/python-3119/)**。

我這裡只放 Windows 64bit 和 macOS 的連結，其他版本請點擊上方安裝 Python 按鈕。

### 1-1. [Windows installer (64-bit)](https://www.python.org/ftp/python/3.11.9/python-3.11.9-amd64.exe)

### 1-2. [macOS 64-bit universal2 installer](https://www.python.org/ftp/python/3.11.9/python-3.11.9-macos11.pkg)

安裝方式和一般的應用程式沒什麼不同，但請 **一定要勾選（如圖示）最下面一行的**

☑ **Add python.exe to PATH**

 ![安裝 Python 請勾選 Add python.exe to PATH](https://vip.studycamp.tw/uploads/default/original/2X/e/e97602b8cebc6eb4c43a8ef4fa92b44afdb7f0dd.jpeg)

* * *

## ▌2. [安裝 PyTorch](https://pytorch.org/get-started/locally/)

選擇你想要安裝的條件，下方會出現對應的指令，複製這些指令。

 ![PyTorch 安裝指令](https://vip.studycamp.tw/uploads/default/original/2X/b/bc9b7ed794e64f9249ac5d1d60a97668432c1fca.png)

然後在命令提示字元下，貼上剛剛複製的指令（按滑鼠右鍵）：

```auto
C:\Users\User> 
pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

```

如果你有安裝 GPU卡（沒有的話，當然只能選 CPU），你可能會有一個問題： **要選擇哪個 CUDA 版本** ？

請在命令提示字元下輸入 `nvcc --version` 即可，以下範例是 `CUDA 11.8`。

```auto
C:\Users\User>nvcc --version

nvcc: NVIDIA (R) Cuda compiler driver
Copyright (c) 2005-2022 NVIDIA Corporation
Built on Wed_Sep_21_10:41:10_Pacific_Daylight_Time_2022
Cuda compilation tools, release 11.8, V11.8.89
Build cuda_11.8.r11.8/compiler.31833905_0

```

* * *

## ▌3-1. [安裝 Chocolatey](https://chocolatey.org/install)

> 這是為了方便安裝下一步的 ffmpeg。如果是 Mac，建議使用 Homebrew。

點擊進入 **[Chocolatey 安裝頁面](https://chocolatey.org/install)** 後，首先要選擇安裝方式，影片示範用 Individual，跟著照做，然後複製 `Now run the following command` 的內容（圖中右下側那個 Copy 的小按鈕）。

 ![Install Chocolatey for Individual Use](https://vip.studycamp.tw/uploads/default/original/2X/9/97dfc02228720bdb530e830af874fdf1a1f3c94e.jpeg)

回到 Windows 工作列，搜尋處輸入 `powershell`，然後將滑鼠移至 Windows PowerShell，按滑鼠右鍵選擇「 **以系統管理員身分執行** 」。

 ![PowerShell 以系統管理員身分執行](https://vip.studycamp.tw/uploads/default/original/2X/3/3ef6b966deab316331cc6305fe45195ec1db5076.jpeg)

再按滑鼠右鍵把剛剛複製的指令貼上。

```auto
Set-ExecutionPolicy Bypass -Scope Process -Force; [System.Net.ServicePointManager]::SecurityProtocol = [System.Net.ServicePointManager]::SecurityProtocol -bor 3072; iex ((New-Object System.Net.WebClient).DownloadString('https://community.chocolatey.org/install.ps1'))

```

* * *

## ▌3-2. 安裝 ffmpeg

安裝完 Chocolatey 之後，接著輸入 `choco install ffmpeg` 來安裝 ffmpeg。

```auto
choco install ffmpeg

```

* * *

## ▌4. 安裝 Whisper

回到 Windows 工作列，搜尋處輸入 `cmd`，然後將滑鼠移至 **命令提示字元** ，按滑鼠右鍵選擇「 **以系統管理員身分執行** 」。

 ![cmd 以系統管理員身分執行](https://vip.studycamp.tw/uploads/default/original/2X/4/4724747786b7f199e5ba974daefd27353a43d503.jpeg)

接著輸入 `pip install -U openai-whisper`，安裝 whisper。

```auto
pip install -U openai-whisper

```

* * *

## ▌開始語音辨識

接著我們來測試一下語音辨識的效果。

到音檔（mp3, wav 皆可）所在路徑，輸入以下指令（Whisper 會自動辨別是哪種語言）：

```auto
whisper test.mp3 --model medium

```

不選擇 model 的話，預設是用 small，以下是可選用的 model 選項。

| Size | Parameters | English-only model | Multilingual model | Required VRAM | Relative speed |
| --- | --- | --- | --- | --- | --- |
| tiny | 39 M | `tiny.en` | `tiny` | ~1 GB | ~10x |
| base | 74 M | `base.en` | `base` | ~1 GB | ~7x |
| small | 244 M | `small.en` | `small` | ~2 GB | ~4x |
| medium | 769 M | `medium.en` | `medium` | ~5 GB | ~2x |
| large | 1550 M | N/A | `large` | ~10 GB | 1x |
| turbo | 809 M | N/A | `turbo` | ~6 GB | ~8x |

說實話，效果真的很不錯，比我以前付費使用的線上語音辨識服務還好（速度更快、效果更好），而且還一次給你五種格式：JSON, srt, tsv, txt, vtt。

以下圖示為佛法轉識成智的語音辨識示範：

 ![Whisper audio to text](https://vip.studycamp.tw/uploads/default/original/2X/b/be767cebfc3b62ad7afceea48c95ed60444fbe1d.png)

* * *

## ▌參考資料

[![](https://img.youtube.com/vi/ABFqbY_rmEk/maxresdefault.jpg "How to Install & Use Whisper AI Voice to Text") ](https://www.youtube.com/watch?v=ABFqbY_rmEk)

* * *

## ▌延伸閱讀

我們在2023年7月，討論過 Whisper 這個主題，不過兩篇文章的目標完全不同。

本文和 OpenAI API 無關，目的在教你如何用 Whisper 來將語音檔轉為文字，完全免費（而且是最簡單的安裝方式，不考慮 Anaconda）。

之前那篇文章，重點在示範程式，如何在 Python 中呼叫 Whisper API：

> [@Whisper: Audio To Text](https://vip.studycamp.tw/t/whisper-audio-to-text/6241/1):
>
> 《2025年1月11日新增說明》本文的重點在示範程式，如果你只是想要在自己的電腦安裝 Whisper 來語音轉文字（寫報告好用！），四個步驟即可完成，請看這篇文章： [用免費開源的 OpenAI Whisper 語音轉文字，自動產生影片字幕檔](https://vip.studycamp.tw/t/topic/7804/1) 我們的 [上一期 OpenAI API 共學](https://vip.studycamp.tw/t/topic/5795) 中，最後一堂也是 Whisper API。 可能是和其他 OpenAI API 的關聯不大，也可能是…
