Irodori-TTSのインストールと使用方法

環境の作成

ここでは、Irodori-TTSを

D:\Irodori-TTS

にインストールします。

コマンドプロンプトで、

D:
cd \
git clone https://github.com/Aratako/Irodori-TTS.git
cd Irodori-TTS

とします。

Python仮想環境の作成

venv を使って仮想環境を作成します。

python -m venv .venv

仮想環境を有効にします。

.venv\Scripts\activate

以降の作業は、この仮想環境を有効にした状態で行います。

Irodori-TTSのインストール

Irodori-TTS本体と必要なPythonライブラリを、Irodori-TTSの配布元の指示に従ってインストールします。

インストール後、Pythonから

import torch
import irodori_tts

が実行できることを確認してください。

GPUを使用する場合は、

python -c "import torch; print(torch.__version__); print('CUDA:', torch.cuda.is_available())"

を実行します。

GPUが利用可能なら、

CUDA: True

と表示されます。

tktts_irodori.py

tktts_irodori.py をPythonからimportできる場所に置きます。

また、共通処理として

tktts_base.py

も必要です。

例えば、

sample_irodori_tts.py
tktts_irodori.py
tktts_base.py

を同じディレクトリに置きます。

Irodori-TTSのサンプル

次のプログラムを sample_irodori_tts.py として保存します。

# sample_irodori_tts.py
#
# Irodori-TTS の簡単な使用例

import tktts_irodori

# モデルを読み込む
model = tktts_irodori.load_model()

# 読み上げる文章
text = """
こんにちは。
これは Irodori TTS を使った音声合成のサンプルです。
ニューラルネットワークを使って、文章から音声を生成しています。
"""

# 音声を生成
tktts_irodori.speak(
    outfile="sample_irodori.wav",
    text=text,
    voice="default",
    caption="落ち着いた自然な声で、明瞭に読み上げる。",
    model=model,
)

print("sample_irodori.wav を作成しました。")

実行します。

python sample_irodori_tts.py

正常に終了すると、

sample_irodori.wav

が作成されます。

Irodori-TTSの声の指定

Irodori-TTSはQwen3-TTSとは声の指定方法が異なります。

Qwen3-TTSでは、

voice="Ono_Anna"

のようにあらかじめ用意された話者を選択できます。

一方、Irodori-TTSでは固定された話者リストを選択するのではなく、caption や参照音声を使って声や話し方を指定します。

例えば、

caption="落ち着いた自然な声で、明瞭に読み上げる。"

のように指定できます。

tktts_irodori.speak(
    outfile="sample_irodori.wav",
    text="熱電材料では、温度差によって電圧が発生します。",
    voice="default",
    caption="大学の講義のように、落ち着いて明瞭に説明する。",
    model=model,
)

参照音声を使用する

Irodori-TTSでは、WAVファイルを参照音声として与えることもできます。

例えば、

tktts_irodori.speak(
    outfile="sample_irodori.wav",
    text="これは参照音声を使用した音声合成です。",
    voice="default",
    caption="自然で明瞭に読み上げる。",
    ref_wav="reference.wav",
    model=model,
)

とします。

この場合、

reference.wav

の音声を参考にして音声が生成されます。