TTSの概略と比較

テキストを音声に変換するツールはText-to-Speech(TTS:音声合成)と呼ばれます。

Pythonから利用できるTTSには、さまざまな方式があります。

ここでは、次の5種類のTTSを比較・説明します。

TTS

位置づけ

主な特徴

Windows TTS (pyttsx3)

基本

軽量、高速、多言語

| | VOICEVOX | 基本 | 手軽で自然な日本語音声

| | Gemini Flash TTS | 発展(クラウド) | 文脈理解による極めて自然な発話、指示文でのトーン制御 | | Qwen3-TTS | 発展(ローカル) | 高品質なニューラルTTS、話者・話し方の指定

| | Irodori-TTS | 発展(ローカル) | 高品質なニューラルTTS、参照音声による声質指定

|

通常の音声読み上げであれば、まず pyttsx3 と VOICEVOX を利用するとよいでしょう。

Qwen3-TTSやIrodori-TTS、Gemini Flash TTSは、より自然な音声生成、文脈に応じた読み分け、声質や話し方の制御など、生成AIを利用した高度な音声合成を試したい場合の発展的な例です。


5種類のTTSの比較

pyttsx3

VOICEVOX

Gemini Flash TTS

Qwen3-TTS

Irodori-TTS

導入

簡単

| 簡単

| APIキー設定のみ(簡単) | やや複雑

| やや複雑

| | 動作環境 | ローカル (GPU不要)

| ローカル (GPU不要可)

| クラウドAPI (要通信) | ローカル (GPU推奨)

| ローカル (GPU推奨)

| | 費用 | 無料 | 無料 | 有料(API従量課金) | 無料 | 無料 | | 起動 | 非常に高速

| Engineを起動

| 即時(起動不要) | モデル読込が必要

| モデル読込が必要

| | 音声生成速度 | 非常に高速

| 高速

| 遅い(通信+生成待ち) | 比較的遅い

| 比較的遅い

| | 音声品質 | 標準的

| 自然

| 極めて自然(文脈理解) | 高品質

| 高品質

| | 話者 | Windows音声

| 多数の話者

| 複数プリセット (Puck等) | モデル内の話者

| 参照音声など

| | 話し方の変更 | 限定的

| Style/速度/Pitch等

| プロンプト指示 | instruct
| caption
| | 多言語 | Windows音声追加

| 主に日本語

| 多言語・文脈自動認識 | モデルに依存

| モデルに依存

| | Python利用 | pyttsx3

| HTTP API

| google-genai SDK | モデル直接利用

| モデル直接利用

| | 主な用途 | 手軽・通知・多言語

| ナレーション・動画

| 講義・自然な文脈ナレーション | 高度な生成AI TTS

| 声質指定・クローン

|

大きく分けると、

                                  TTS
                                   │
          ┌────────────────────────┼────────────────────────┐
          │                        │                        │
     手軽に利用 (ローカル)        クラウド型AI (API)        高度な生成AI (ローカル)
          │                        │                        │
     ┌────┴────┐                   │                   ┌────┴────┐
  pyttsx3   VOICEVOX        Gemini Flash TTS        Qwen3      Irodori
     │          │                  │                   │          │
 Windows TTS   Engine          Google API           AIモデル   AIモデル

と考えることができます。


手軽に利用できるTTS

Windows TTS (pyttsx3)

pyttsx3 は、Windowsに用意されているTTS機能をPythonから利用する方法です。

Python
  ↓
pyttsx3
  ↓
Windows TTS
  ↓
音声

特徴は、

  • インストールが簡単

  • GPU不要

  • 非常に高速

  • モデルの読み込みが不要

  • WindowsにインストールしたTTS音声を利用できる

  • Windowsに各言語の音声を追加することで多言語に対応できる

という点です。

簡単な読み上げ、プログラムからの音声通知、多言語の読み上げなどであれば、非常に手軽に利用できます。


VOICEVOX

VOICEVOXは、VOICEVOX Engineを利用して音声を生成します。

Python
  ↓
tktts_voicevox.py
  ↓
HTTP API
  ↓
VOICEVOX Engine
  ↓
ニューラル音声合成
  ↓
WAVファイル

VOICEVOXは特に日本語の音声生成に便利です。

特徴は、

  • 導入が比較的簡単

  • 自然な日本語音声

  • 多数の話者

  • 話者ごとに複数のStyle

  • PythonからHTTP APIで簡単に利用可能

という点です。

日本語の教材や動画のナレーションなど、手軽さと自然な日本語音声の両方が必要な用途に適しています。


クラウド型生成AI TTS

Gemini Flash TTS

Gemini Flash TTS(例: gemini-3.8-flash-tts)は、Googleのマルチモーダル基底モデルを活用したクラウド型の音声合成機能です。

Python
  ↓
google-genai SDK
  ↓
Google Gemini API (クラウド)
  ↓
大規模言語・音声モデル
  ↓
WAVファイル

文章全体の文脈を理解した上で音声を合成するため、従来のTTSが苦手としていた専門用語の読み分けや、漢字の誤読が非常に少ないという大きな特徴があります。

主なメリット:

  • 圧倒的な文脈理解と自然さ: 機械的な不自然さが少なく、文脈に即した抑揚で流暢に読み上げる

  • 専門用語の読み間違いが少ない: 理数・技術系の用語や学術的な文章でも、辞書登録の手間を最小限に抑えられる

  • ローカルマシンの負荷がゼロ: GPUなどの強力なハードウェアを必要とせず、ノートPCでも動作する

  • トーン・感情の指示: プロンプトとして「落ち着いた講義調で」「明るく」といった指示を与えられる

デメリット・注意点:

  • 費用が発生する(有料): ローカルTTSとは異なり、APIの利用量(トークン/文字数)に応じた従量課金が発生する

  • 生成速度が遅い: ネットワークを介した通信レイテンシに加え、大規模モデルによる逐次生成が行われるため、pyttsx3やVOICEVOXに比べて生成完了までの待ち時間が長くなる

  • インターネット接続が必須: オフライン環境では利用できない


高度なローカル生成AI TTS

Qwen3-TTS

Qwen3-TTSでは、Pythonからローカルのニューラルネットワークモデルを直接利用して音声を生成します。

Python
  ↓
Qwen3-TTSモデル
  ↓
ニューラル音声生成
  ↓
WAVファイル

モデルに用意された話者(Ono_Anna など)を選択し、instruct="落ち着いた講義調で" のように文章で話し方を細かくコントロールできます。ローカルGPU環境があり、オフラインかつ無料で高度な音声制御を試したい場合に適しています。


Irodori-TTS

Irodori-TTSも、ローカル環境でPythonからニューラルネットワークモデルを直接利用します。

Python
  ↓
Irodori-TTSモデル
  ↓
ニューラル音声生成
  ↓
WAVファイル

固定話者から選ぶのではなく、caption による話し方指定や、ref_wav による参照音声(Voice Clone)を利用できるのが大きな特徴です。特定の話者の声を真似させたい、オリジナルの声質でナレーションを作成したいといった用途に強みがあります。


どのTTSを使うか

用途や環境、求める品質に応じて最適なTTSを選択します。

目的・状況

適したTTS

備考

とにかく高速・軽量に読み上げたい

| pyttsx3
| GPU不要、オフライン動作

| | 無料で自然な日本語ナレーションを作りたい

| VOICEVOX
| キャラクターボイスが中心

| | 多少のコストや待ち時間を許容し、最高品質の自然な講義音声を作りたい | Gemini Flash TTS | 誤読が極めて少なく、真面目なナレーションに最適 | | オフライン・無料で高度な話し方制御を行いたい | Qwen3-TTS | 要GPU、ローカルモデル読込

| | 特定の話者の声質(参照音声)を再現したい | Irodori-TTS
| 要GPU、Voice Clone対応

|


まとめ

各TTSは以下のように使い分けることができます。

導入・運用のしやすさ重視(無料・ローカル)
    │
    ├─ とにかく軽量・高速
    │       ↓
    │    pyttsx3
    │
    └─ 自然な日本語音声(キャラクター調)
            ↓
         VOICEVOX


品質重視・文脈読み分け重視(有料・クラウド)
    │
    └─ 誤読が少なく極めて自然なナレーション(講義・学術向け)
            ↓
       Gemini Flash TTS (有料・やや遅い)


ローカル生成AIによる高度な制御(無料・要GPU)
    │
    ├─ 話者を選択し、指示文で制御
    │       ↓
    │    Qwen3-TTS
    │
    └─ 参照音声による声質指定・Voice Clone
            ↓
         Irodori-TTS

一般的な利用では手軽な pyttsx3 や VOICEVOX で十分対応できますが、専門用語が多く誤読を極力減らしたいスライド講義などでは、APIコストや生成待ち時間を考慮しても Gemini Flash TTS が有力な選択肢となります。