翻訳(Translate)
設定:音声認識/合成
このページでは右クリックメニューの「設定」サブメニューにある項目「本体設定」で開くダイアログの、「音声認識/合成」ページについて解説しています。
このページではSSPの音声認識・合成機能の設定を行います。
機能の使い方は、それぞれ「音声認識」「音声合成」のページをご覧ください。
パソコンで音声認識や音声合成を使えない場合は、それぞれのグループ内の項目がグレーになり、選べません。
各項目の「(System Default)」は、Windowsの設定で選ばれているものを使う、という意味です。通常はそのままで問題ありません。
各項目の解説
音声認識
機能→音声認識 メニューを選んで、認識パレットを開いて使用してください。
この欄の設定は、変更するとすぐに、開いている認識パレットへ反映されます。SSPを再起動する必要はありません。
- 認識エンジン
- 音声認識エンジンを変更します。(System Default)で音声認識コントロールパネルで選択したものが使用されます。
パソコンに複数の認識エンジンが入っている場合に、話す言葉に合ったものを選んでください。 - プロファイル
- 認識精度を高めるための学習情報を切り替えます。(System Default)で音声認識コントロールパネルで選択したものが使用されます。
ユーザーごとにトレーニング結果を使い分けたい時に切り替えます。 - 認識エンジンの設定・マイクの設定・トレーニング
- それぞれ、認識エンジンによっては設定可能になります。通常はすべて無効です。
有効な場合は、押すと認識エンジンが用意している設定画面が開きます。「マイクの設定」ではマイクの音量調整、「トレーニング」では声の癖を覚えさせて認識精度を上げることができます。 - 音声入力元
- 音声入力元となるマイク端子やヘッドセットなどを切り替えます。(System Default)で音声認識コントロールパネルで選択したものが使用されます。
右の「設定...」は、選んだ入力元に専用の設定画面がある場合だけ押せます。
音声合成
機能→音声合成 メニューをONにして使用してください。
この欄の設定は、変更したあと次の読み上げから反映されます。SSPを再起動する必要はありません。
- \0(メインキャラクター)
- メインキャラクター(\0)の音声を設定します。音声の選択、ピッチの調整、設定ボタンから詳細設定が行えます。
- \1(サブキャラクター)
- サブキャラクター(\1)の音声を設定します。音声の選択(\0や\2と同じでも可)、ピッチの調整、設定ボタンから詳細設定が行えます。
- \2~(その他のキャラクター)
- \2以降の追加キャラクターの音声を設定します。音声の選択(\0や\1と同じでも可)、ピッチの調整、設定ボタンから詳細設定が行えます。
- 音声の選択
-
一覧には、Windowsに入っている音声と、外部の音声合成を使うための枠「LocalAPI-0〜9」「CloudAPI-0〜9」が並びます。
「LocalAPI-」「CloudAPI-」の枠は、選んだあと右の「設定...」で接続先などを設定してから使います。
Windowsの音声は、音声ごとに専用の設定画面がある場合に限り「設定...」が押せます。 - ピッチ
-
声の高さです。-10〜10の範囲で選べます(0が基準)。数字が大きいほど高い声になります。
初期値は、\0が0、\1が+5(少し高め)、\2~が-5(少し低め)です。 - 音声出力先
- 音声を出力するスピーカーやイヤホン端子等の出力先を切り替えます。設定ボタンから詳細設定が行えます。
- 喋る速度
- 音声合成の読み上げスピードを調整します。スライダーで「遅い」から「速い」まで設定できます。標準位置から調整してください。
全キャラクター共通の設定です。 - 音量
- 音声合成の音量レベルを調整します。スライダーで0%から100%まで設定できます。初期値は100%です。
全キャラクター共通の設定です。 - 音声合成の進行速度に合わせてスクリプトの再生待ちを行う
-
音声合成の読み上げ速度に合わせて、スクリプトの表示タイミングを同期させます。
オフの場合は、バルーンの文字がいつもの速さで進み、声はそれを追いかけます。オンにすると、声が追いつくまでゴーストの再生が待たされ、声と文字のずれが小さくなります(その代わり、合成に時間がかかるとゴーストの動きも遅くなります)。初期設定はオフです。
音声合成の詳細設定ダイアログ (右側の設定ボタン)
「LocalAPI-」「CloudAPI-」の枠で「設定...」を押すと開きます。使うソフトやサービスの種類を選び、必要な項目を入力します。
クラウド音声合成を使う場合のAPIキーを除き、すべて省略可能です。必要なものだけ入力し、残りは空欄にしてください。選んだ種類で使わない項目は、グレーで入力できなくなります。
- 種類
- 使う音声合成ソフト・サービスを選びます。LocalAPIの枠ではローカルのソフト、CloudAPIの枠ではクラウドのサービスが選べます。
- ボイスID/スタイルID/参照...
-
使う声を指定します。「参照...」を押すと、接続先のソフトから声の一覧を取得して、名前を見ながら選べます。IDが分かっている場合は直接入力しても構いません。
LocalAPIの「参照...」は、接続先のソフトが起動していないと一覧が出ません(ブザー音が鳴ります)。先にソフトを起動してから押してください。
Aivis Cloud APIとOpenAI TTSの「参照...」は、一覧を取得せず、声の一覧が載っているWebページをブラウザで開きます。 - ホスト名/IP・ポート番号
- LocalAPIで、接続先のソフトが動いているパソコンを指定します。同じパソコン内で動かすなら空欄で問題ありません。
- APIキー
- クラウドのサービスに接続するための鍵です。サービスの管理画面で取得して貼りつけてください。
LocalAPI
- VOICEVOX,VOICEVOX Nemo,SHAREVOX,AivisSpeech
- ボイスIDは参照ボタンでキャラクター名を見ながら選択できます。IDが分かっている方はそのまま入力しても構いません。
ホスト名・ポート番号は同じPC内で動かすなら空欄で問題ありません。 - COEIROINK v2
- ボイスIDとスタイルIDは参照ボタンでキャラクター名を見ながら選択できます。IDが分かっている方はそのまま入力しても構いません。
スタイルIDにはスタイル名(「れいせい」など)を入力してください。IDが分かっている方はIDも通ります。
ホスト名・ポート番号は同じPC内で動かすなら空欄で問題ありません。 - Style-BERT-VITS2
- ボイスIDとスタイルIDは参照ボタンでキャラクター名を見ながら選択できます。IDが分かっている方はそのまま入力しても構いません。
スタイルIDにはスタイル名を入力してください。IDが分かっている方はIDも通ります。
ホスト名・ポート番号は同じPC内で動かすなら空欄で問題ありません。
Server.bat(server_fastapi.py)を起動してください。 - OpenAI TTS - Local (ローカルAPI互換)
- ボイスIDにはText-to-speech AIモデルの名前を入力してください。例えば「irodori-tts」などです。
スタイルIDは互換サーバの仕様に従って入力してください。例えばIrodori-TTS-Serverの場合はvoicesフォルダに入れた参照音声のwavファイル名(拡張子なし)です。
ホスト名は同じPC内で動かすなら空欄で問題ありません。ポート番号はサービスごとの設定が必要です。例えばIrodori-TTS-Serverの場合は8088になります。
CloudAPI
- Aivis Cloud API
- ボイスIDには「モデル UUID」をコピーして入力してください。注意!話者UUIDではありません。
スタイルIDはボイスの詳細ページに書いてあります。
ピッチは0が推奨です。それ以外だと合成スピードが落ちるそうです。
APIキーはこちらのダッシュボードから取得できますので、キー欄に貼りつけてください。 - OpenAI TTS - Cloud (クラウドAPI・または互換サービス)
- ボイスIDにはText-to-speech AIモデルの名前を入力してください。例えば「gpt-4o-mini-tts」「tts-1」などです。
スタイルIDはこちらのドキュメントの「Voice options」セクションに書いてある名前を入力してください。例:「marin」「cedar」
APIキーはこちらのダッシュボードから取得できますので、キー欄に貼りつけてください。
互換サービスを使う場合は、ホスト名を設定してください。OpenAIのText-to-speechを使う場合は空欄で問題ありません。
下部のボタン
- ヘルプ
-
本体設定ダイアログの、設定中のページのヘルプ(つまりこのページ)を開きます。
ダイアログ右上の「?」マークも同様です。 - 閉じる
-
本体設定ダイアログを閉じます。
ダイアログ右上の「×」マークも同様です。