🎙️ CosyVoice2 WebUI 操作教學

手把手教你:置入參考聲線 & 產出不同情緒的語音

非工程師版 — 照著介面一步一步點就會

🖥️ 先認識這個介面

CosyVoice WebUI 介面

這是 CosyVoice WebUI 主畫面,重點欄位:

  • 🔘 選擇推理模式:預訓練音色 / 3s極速復刻 / 跨語種複刻 / 自然語言控制
  • 📝 輸入合成文本:你要它念出來的台詞
  • 📤 選擇prompt音頻文件:上傳你要複製的聲音
  • 📄 輸入prompt文本:參考音檔「實際講了什麼」
  • 速度調節 / 🎲 隨機推理種子
  • ▶️ 生成音頻 按鈕 → 🔊 合成音頻 輸出
核心操作

① 置入參考聲線(3s極速復刻)

想複製某個人的聲音來念你的台詞,照這 7 步做:

  1. 選擇推理模式 點選 → 「3s極速復刻」
  2. 選擇prompt音頻文件 點上傳,選你要複製的 .wav 參考音檔(或用「錄製」直接錄一段)
  3. 輸入prompt文本 填「參考音檔實際講的那句話(逐字)」
    ⚠️ 這不是要生成的字,是參考音檔的內容,必須跟音檔一致
  4. 輸入合成文本 填你真正想生成的台詞,例:Blanka, Bomb!
  5. 設定 速度調節(1.0原速)、隨機推理種子(填數字如 42);是否流式推理 選「否」
  6. 「生成音頻」 按鈕
  7. 右側 合成音頻 出現播放器 → 試聽 → 點下載圖示存成 wav
💡 小技巧:若在 參考音頻列表 選內建的音檔,系統會自動帶出對應的 prompt 文本,不用自己打。
核心操作

② 產出不同情緒的語音

方法 A:用標點 + 速度 + 種子(同一聲線做出不同情緒)

情緒合成文本(標點)速度
興奮Blanka, Bomb!1.05
低沉厚重Blanka... Bomb.0.88
誇張Blanka!! Bomb!!1.10
驚喜Blanka?! Bomb!1.0
標點控「語氣形狀」、速度控「節奏」、種子換「不同表演版本」。
不滿意就換一個種子數字再生成。

方法 B:用「自然語言控制」直接描述情緒

  1. 推理模式選 「自然語言控制」
  2. 輸入instruct文本 用文字描述語氣,例如:
    「用非常興奮、活力十足的語氣說」
    「用低沉、穩重、有氣勢的英雄語氣」
    「用誇張、像街機廣播的方式大聲喊」
  3. 輸入合成文本 填台詞(Blanka Bomb)
  4. 生成音頻,模型就會照你描述的情緒念

🔘 四種推理模式怎麼選

模式用途什麼時候用
預訓練音色用系統內建的現成聲音只要快速產出、用內建聲線
3s極速復刻上傳一段音檔就複製那個人的聲音要做客製聲線(最常用)
跨語種複刻參考音檔是A語言,生成B語言複製聲音但要換語言(中文參考→念英文)
自然語言控制用文字描述情緒/風格要精細指定表演感
一句話選法:
• 用內建聲音 → 預訓練音色
• 複製某人聲音、同語言 → 3s極速復刻
• 複製聲音但要換語言 → 跨語種複刻
• 想用文字描述情緒 → 自然語言控制

💾 把聲線存起來重複使用

保存音色模型 / 輸入新的音色名稱 是做什麼的?
→ 把「複製好的聲線」存成一個音色,下次不用再上傳參考音檔

存起來:

  1. 先用「3s極速復刻」上傳參考音檔、填 prompt 文本、生成一次確認 OK
  2. 輸入新的音色名稱 打個名字,例:Jimmy_遊戲女聲
  3. 保存音色模型

下次重複用:

  1. 改用 預訓練音色 模式
  2. 選擇預訓練音色 下拉,就會看到剛存的 Jimmy_遊戲女聲
  3. 選它 → 直接填合成文本 → 生成(不用再上傳參考音檔!)
若下拉沒立刻出現,按「刷新音色」或重開 WebUI。

⚠️ 操作注意重點

  • 參考音檔取樣率 ≥16kHz,建議用 24kHz、單聲道、乾淨無雜音
  • prompt文本 一定要跟參考音檔內容逐字一致,否則聲音會不準
  • 參考音檔越乾淨越好;來源很吵先降噪再上傳(別過度處理以免失真)
  • 參考句用「完整一句、發音清楚」的,太短片段容易出現多念/重複的怪聲
  • 生成後先試聽確認字正確、沒多字漏字;不滿意換種子數字再生成
  • 英文專有名詞被念裂(Blanka→Blank a),在文本加逗號「Blanka, Bomb!」讓它更順
  • 速度調節 只在「是否流式推理」選「否」時有效
  • 常用聲線記得存成音色模型,下次選「預訓練音色」直接叫用

🎉 你學會了!

置入參考聲線(3s極速復刻)→ 調整情緒(標點/速度/種子 或 自然語言控制)→ 生成 → 試聽 → 下載

掌握這套流程,就能用任何聲線產出各種情緒的遊戲語音 🎙️