VoiceStudio 是什麼?本地 AI 配音介紹與電腦配置分級

VoiceStudio 本地 AI 配音工作室與電腦配置指南

VoiceStudio 把文字轉語音、聲音複製、影片配音與批量音訊製作放進同一個桌面介面。對想做遊戲角色試音、影片旁白或語言教材的人來說,它最有意思的地方,是可以把支援的語音模型放在自己的電腦上跑。

不過,「能安裝」和「適合每天拿來配音」有段距離。這篇先用一張四級配置表,幫你判斷手上的 Windows、Linux 或 Mac 適合做什麼,再介紹功能與開始使用的方法。

VoiceStudio 是什麼?值得看的是整合工作流程

本文介紹的是 debpalash/VoiceStudio,一個以本地運算為主的 AI 語音桌面工具。你可以選模型、管理聲音與腳本,再把生成的音訊放進配音工作流程;目前預設文字轉語音引擎是 OmniVoice。

最值得關注的功能有四種:

  • 文字配音與聲音複製:輸入腳本生成語音,或用有權使用的參考錄音建立聲音特徵。複製能力取決於引擎。
  • 聲音設計:依年齡、音高、口音等屬性嘗試不同聲線,適合角色試音;可控制的項目依模型而異。
  • 影片配音:把轉錄、翻譯、分段語音生成與音訊組合串起來,省去在多個工具之間搬素材的步驟。
  • 長篇與批量製作:處理有聲書、旁白段落或多筆工作;也提供 API 與 MCP 介面,方便串進自己的流程。

這些是官方文件列出的能力,並不代表每個模型都能做到同樣的語言、聲線或情緒品質。做繁中或日語內容,應先用自己的文本試聽。功能範圍可查 官方功能目錄。

本地運算也需要完成安裝:第一次啟動會下載執行環境與模型。選用遠端後端、雲端翻譯或外部服務時,仍會有網路傳輸;想保留素材在本機,就要確認整條流程使用的服務。

電腦配置分四級,先看自己在哪一級

下表是本文整理的實務配置建議,不是官方統一最低需求,也不是各機型速度實測。 等級按工作用途與記憶體餘裕劃分;較高等級代表比較有空間安排工作,不代表聲音一定更自然。

等級 Windows/Linux 配置方向 Apple Silicon Mac 配置方向 建議用途
第 0 級:先體驗 16GB RAM;沒有可用的 GPU 加速,走 CPU 已有 8GB 機型只試輕量引擎與短句;不建議為此新購 熟悉介面、少量短句;需接受等待與模型限制
第 1 級:入門配音 NVIDIA 6–8GB VRAM+16GB RAM 16GB 共享記憶體 短旁白、角色試音;一次處理一個工作
第 2 級:日常創作 NVIDIA 12GB VRAM+32GB RAM 24–32GB 共享記憶體 經常改稿重配、分段長文、短影片配音
第 3 級:批量製作 NVIDIA 16–24GB 以上 VRAM+64GB RAM 48–64GB 以上共享記憶體 長篇音訊、多筆工作佇列、較多模型切換

一般個人創作者可以先以第 2 級為目標;已有第 1 級電腦,先試再升級。 第 3 級適合已有明確工作量的人,不必為了第一次體驗就買高階設備。8GB Mac 那一列只是保守的試用方向,並非已驗證能穩定跑預設模型。

這張表有三個判讀重點:

  1. PC 的 VRAM 與 RAM 要分開看。 32GB 系統 RAM 不會把一張 4GB 顯示卡變成 12GB 顯示卡。
  2. Mac 的共享記憶體由系統、GPU 與其他程式共用。 24GB Mac 不等於 24GB 獨立 VRAM,也不能靠這張表推算和 PC 誰比較快。
  3. 多模型工作比單純念一句話更吃餘裕。 影片配音還包含語音辨識等步驟;記憶體不足可能造成模型反覆卸載與重新載入。

分級的官方依據是:OmniVoice 引擎文件建議獨立 GPU 至少有 6GB VRAM;效能指南則指出,16GB Apple Silicon 在配音時可能需要交替卸載模型。NVIDIA 大記憶體配置可提供更多並行空間,Apple Silicon 目前仍按單次生成設計,增加記憶體主要改善餘裕與載入切換。

先確認平台,避免買了顯示卡卻沒有加速

Windows 10/11 的 x64 電腦是常見使用路線。主要 PyTorch 引擎的 GPU 加速走 NVIDIA CUDA;沒有支援的 GPU 也可用 CPU。一般安裝包會依環境處理執行環境,不必先照網路教學自行裝整套 CUDA Toolkit。

Windows 的 AMD Radeon 或 Intel 顯示卡,不能直接加速這套安裝環境中的 PyTorch 引擎。部分其他引擎有不同路徑,例如 audio.cpp 可走 Vulkan,因此不能只看到「有顯示卡」就套用上表的 NVIDIA 等級。官方 Windows 安裝說明有完整區分;Windows ARM 目前仍屬實驗支援。

Apple Silicon Mac可使用 MPS,部分模型另有 MLX 路徑;官方 macOS 安裝文件列出 macOS 13.3 以上,應下載原生 arm64 安裝包。Intel Mac 目前不支援本地後端,只能使用介面連到其他電腦的遠端後端,不能把它當成「較慢的 CPU 版 Mac」來買。官方 macOS 安裝說明

Linux 使用 NVIDIA 是另一條路線;AMD ROCm 則要依顯示卡、系統與引擎確認相容性。新手若只是想先做出一段旁白,建議從已有且受支援的平台開始。

模型怎麼選?先選語言,再看電腦能否負擔

想做中文、日語或聲音複製,可以先試預設 OmniVoice。 先生成一小段,確認發音與聲線,再決定是否值得擴大工作量;語言覆蓋範圍不代表每種口音都一樣成熟。

只有 CPU、又只需要英文旁白,可以考慮 KittenTTS。 它是輕量的英文預設聲線引擎,沒有聲音複製功能。這是換一種較小的工作需求,不是讓低階電腦免費獲得完整版能力。KittenTTS 文件

儲存空間也要預留。官方 Windows 與 macOS 指南以約 10GB 可用空間作為基本安裝估計;本文建議初次使用留 20GB 以上 SSD 空間,準備裝多套模型或累積影片素材則留 50–100GB 以上。後兩個數字是管理餘裕建議,不是固定安裝大小,實際用量會隨模型與素材增加。

第一次使用,先完成一段短旁白

  1. 從 官方 Releases 選擇符合平台與處理器架構的安裝包,完成環境與模型下載。
  2. 開啟 Settings → Performance,檢查運算裝置與 GPU active 狀態;再到 Settings → About → Run self-check 檢查環境。
  3. 在 Model Catalogue 選擇支援目標語言的引擎。先試三到五句,不要第一次就丟整篇文章或長影片。
  4. 複製聲音時,使用自己的或已取得授權的乾淨錄音,避開背景音樂、多人同時說話與明顯雜訊。
  5. 第二次生成再觀察速度。第一次包含模型載入,不能直接當成平常工作速度;長文採分段處理,記憶體吃緊時減少其他程式與同時工作的模型。

如果要比較電腦,應固定引擎、文本、輸出設定與模型是否已載入,再記錄生成耗時。官方硬體基準頁截至本文查核日尚未提供已驗證的測試列,因此這篇不宣稱哪張卡一定比哪台 Mac 快幾倍。

要做商業配音,另外確認模型授權

VoiceStudio 應用程式採 AGPL-3.0-only,模型權重另有條款。目前預設 OmniVoice 的程式碼採 Apache 2.0,但預訓練權重採 CC-BY-NC 非商用授權。不能因為應用程式開源,就直接推論生成內容可用在付費遊戲、廣告或接案;使用前應核對所選模型與參考聲音的權利。應用程式的付費方案也不會自動替換模型授權。VoiceStudio 授權說明、OmniVoice 模型卡

對我來說,VoiceStudio 值得介紹的方向,是把本地語音模型變成更容易使用的創作流程。先拿現有電腦做一段短旁白,確認語言、聲音和等待時間都能接受,再按真正的工作量升級配置,會比直接追最高規格更有幫助。

若你的需求是即時對話練習,也可以延伸閱讀本站的 ChatGPT 語音模式學日語實戰,再依「做教材音訊」或「口說互動」選擇工具。

本文資料查核日期:2026 年 10 月 5 日。配置表為文件整理後的實務建議;未在各級硬體上進行 VoiceStudio 實測。