翻訳(Translate)

設定:音声認識/合成

このページでは右クリックメニューの「設定」サブメニューにある項目「本体設定」で開くダイアログの、「音声認識/合成」ページについて解説しています。

このページではSSPの音声認識・合成機能の設定を行います。

機能の使い方は、それぞれ「音声認識」「音声合成」のページをご覧ください。

パソコンで音声認識や音声合成を使えない場合は、それぞれのグループ内の項目がグレーになり、選べません。
各項目の「(System Default)」は、Windowsの設定で選ばれているものを使う、という意味です。通常はそのままで問題ありません。

各項目の解説

音声認識

機能→音声認識 メニューを選んで、認識パレットを開いて使用してください。

この欄の設定は、変更するとすぐに、開いている認識パレットへ反映されます。SSPを再起動する必要はありません。

認識エンジン
音声認識エンジンを変更します。(System Default)で音声認識コントロールパネルで選択したものが使用されます。
パソコンに複数の認識エンジンが入っている場合に、話す言葉に合ったものを選んでください。
プロファイル
認識精度を高めるための学習情報を切り替えます。(System Default)で音声認識コントロールパネルで選択したものが使用されます。
ユーザーごとにトレーニング結果を使い分けたい時に切り替えます。
認識エンジンの設定・マイクの設定・トレーニング
それぞれ、認識エンジンによっては設定可能になります。通常はすべて無効です。
有効な場合は、押すと認識エンジンが用意している設定画面が開きます。「マイクの設定」ではマイクの音量調整、「トレーニング」では声の癖を覚えさせて認識精度を上げることができます。
音声入力元
音声入力元となるマイク端子やヘッドセットなどを切り替えます。(System Default)で音声認識コントロールパネルで選択したものが使用されます。
右の「設定...」は、選んだ入力元に専用の設定画面がある場合だけ押せます。

音声合成

機能→音声合成 メニューをONにして使用してください。

この欄の設定は、変更したあと次の読み上げから反映されます。SSPを再起動する必要はありません。

\0(メインキャラクター)
メインキャラクター(\0)の音声を設定します。音声の選択、ピッチの調整、設定ボタンから詳細設定が行えます。
\1(サブキャラクター)
サブキャラクター(\1)の音声を設定します。音声の選択(\0や\2と同じでも可)、ピッチの調整、設定ボタンから詳細設定が行えます。
\2~(その他のキャラクター)
\2以降の追加キャラクターの音声を設定します。音声の選択(\0や\1と同じでも可)、ピッチの調整、設定ボタンから詳細設定が行えます。
音声の選択
一覧には、Windowsに入っている音声と、外部の音声合成を使うための枠「LocalAPI-0〜9」「CloudAPI-0〜9」が並びます。
「LocalAPI-」「CloudAPI-」の枠は、選んだあと右の「設定...」で接続先などを設定してから使います。
Windowsの音声は、音声ごとに専用の設定画面がある場合に限り「設定...」が押せます。
ピッチ
声の高さです。-10〜10の範囲で選べます(0が基準)。数字が大きいほど高い声になります。
初期値は、\0が0、\1が+5(少し高め)、\2~が-5(少し低め)です。
音声出力先
音声を出力するスピーカーやイヤホン端子等の出力先を切り替えます。設定ボタンから詳細設定が行えます。
喋る速度
音声合成の読み上げスピードを調整します。スライダーで「遅い」から「速い」まで設定できます。標準位置から調整してください。
全キャラクター共通の設定です。
音量
音声合成の音量レベルを調整します。スライダーで0%から100%まで設定できます。初期値は100%です。
全キャラクター共通の設定です。
音声合成の進行速度に合わせてスクリプトの再生待ちを行う
音声合成の読み上げ速度に合わせて、スクリプトの表示タイミングを同期させます。
オフの場合は、バルーンの文字がいつもの速さで進み、声はそれを追いかけます。オンにすると、声が追いつくまでゴーストの再生が待たされ、声と文字のずれが小さくなります(その代わり、合成に時間がかかるとゴーストの動きも遅くなります)。初期設定はオフです。

音声合成の詳細設定ダイアログ (右側の設定ボタン)

「LocalAPI-」「CloudAPI-」の枠で「設定...」を押すと開きます。使うソフトやサービスの種類を選び、必要な項目を入力します。
クラウド音声合成を使う場合のAPIキーを除き、すべて省略可能です。必要なものだけ入力し、残りは空欄にしてください。選んだ種類で使わない項目は、グレーで入力できなくなります。

種類
使う音声合成ソフト・サービスを選びます。LocalAPIの枠ではローカルのソフト、CloudAPIの枠ではクラウドのサービスが選べます。
ボイスID/スタイルID/参照...
使う声を指定します。「参照...」を押すと、接続先のソフトから声の一覧を取得して、名前を見ながら選べます。IDが分かっている場合は直接入力しても構いません。
LocalAPIの「参照...」は、接続先のソフトが起動していないと一覧が出ません(ブザー音が鳴ります)。先にソフトを起動してから押してください。
Aivis Cloud APIとOpenAI TTSの「参照...」は、一覧を取得せず、声の一覧が載っているWebページをブラウザで開きます。
ホスト名/IP・ポート番号
LocalAPIで、接続先のソフトが動いているパソコンを指定します。同じパソコン内で動かすなら空欄で問題ありません。
APIキー
クラウドのサービスに接続するための鍵です。サービスの管理画面で取得して貼りつけてください。

LocalAPI

VOICEVOX,VOICEVOX Nemo,SHAREVOX,AivisSpeech
ボイスIDは参照ボタンでキャラクター名を見ながら選択できます。IDが分かっている方はそのまま入力しても構いません。
ホスト名・ポート番号は同じPC内で動かすなら空欄で問題ありません。
COEIROINK v2
ボイスIDとスタイルIDは参照ボタンでキャラクター名を見ながら選択できます。IDが分かっている方はそのまま入力しても構いません。
スタイルIDにはスタイル名(「れいせい」など)を入力してください。IDが分かっている方はIDも通ります。
ホスト名・ポート番号は同じPC内で動かすなら空欄で問題ありません。
Style-BERT-VITS2
ボイスIDとスタイルIDは参照ボタンでキャラクター名を見ながら選択できます。IDが分かっている方はそのまま入力しても構いません。
スタイルIDにはスタイル名を入力してください。IDが分かっている方はIDも通ります。
ホスト名・ポート番号は同じPC内で動かすなら空欄で問題ありません。
Server.bat(server_fastapi.py)を起動してください。
OpenAI TTS - Local (ローカルAPI互換)
ボイスIDにはText-to-speech AIモデルの名前を入力してください。例えば「irodori-tts」などです。
スタイルIDは互換サーバの仕様に従って入力してください。例えばIrodori-TTS-Serverの場合はvoicesフォルダに入れた参照音声のwavファイル名(拡張子なし)です。
ホスト名は同じPC内で動かすなら空欄で問題ありません。ポート番号はサービスごとの設定が必要です。例えばIrodori-TTS-Serverの場合は8088になります。

CloudAPI

Aivis Cloud API
ボイスIDには「モデル UUID」をコピーして入力してください。注意!話者UUIDではありません。
スタイルIDはボイスの詳細ページに書いてあります。
ピッチは0が推奨です。それ以外だと合成スピードが落ちるそうです。
APIキーはこちらのダッシュボードから取得できますので、キー欄に貼りつけてください。
OpenAI TTS - Cloud (クラウドAPI・または互換サービス)
ボイスIDにはText-to-speech AIモデルの名前を入力してください。例えば「gpt-4o-mini-tts」「tts-1」などです。
スタイルIDはこちらのドキュメントの「Voice options」セクションに書いてある名前を入力してください。例:「marin」「cedar」
APIキーはこちらのダッシュボードから取得できますので、キー欄に貼りつけてください。
互換サービスを使う場合は、ホスト名を設定してください。OpenAIのText-to-speechを使う場合は空欄で問題ありません。

下部のボタン

ヘルプ
本体設定ダイアログの、設定中のページのヘルプ(つまりこのページ)を開きます。
ダイアログ右上の「?」マークも同様です。
閉じる
本体設定ダイアログを閉じます。
ダイアログ右上の「×」マークも同様です。