transcribe_qwen3_asr 実行例

help出力 transcribe_qwen3_asr.py --help

usage: transcribe_qwen3_asr.py [-h] [--backend {qwen3-asr}]
                               [-m {0.6B,1.7B,Qwen/Qwen3-ASR-0.6B,Qwen/Qwen3-ASR-1.7B}]
                               [-l LANG] [-d DEVICE]
                               [--dtype {auto,bfloat16,float16,float32}]
                               [--timestamps {0,1}] [--aligner ALIGNER]
                               [--attention {auto,sdpa,eager,flash_attention_2}]
                               [--max-inference-batch-size MAX_INFERENCE_BATCH_SIZE]
                               [--max-new-tokens MAX_NEW_TOKENS]
                               [--chunk-seconds CHUNK_SECONDS]
                               [--chunk-overlap CHUNK_OVERLAP]
                               [--outfile1 OUTFILE1] [--outfile2 OUTFILE2]
                               [--outfile3 OUTFILE3] [--pause {0,1}]
                               infile

Qwen3-ASR音声文字起こしツール(ASRバックエンド拡張対応)

positional arguments:
  infile                入力音声ファイル名(glob可)

options:
  -h, --help            show this help message and exit
  --backend {qwen3-asr}
                        ASRバックエンド (default: qwen3-asr)
  -m, --model {0.6B,1.7B,Qwen/Qwen3-ASR-0.6B,Qwen/Qwen3-ASR-1.7B}
                        Qwen3-ASRモデル (default: 0.6B)
  -l, --lang LANG       言語コード/名称。autoまたは空文字で自動判定 (default: ja)
  -d, --device DEVICE   auto, cpu, cuda, cuda:0など (default: auto)
  --dtype {auto,bfloat16,float16,float32}
                        推論精度 (default: auto)
  --timestamps {0,1}    ForcedAlignerで時刻を付けるか (default: 1)
  --aligner ALIGNER     時刻推定モデル
  --attention {auto,sdpa,eager,flash_attention_2}
                        Attention実装 (default: auto)
  --max-inference-batch-size MAX_INFERENCE_BATCH_SIZE
                        推論バッチ上限。小さい値はVRAMを節約 (default: 1)
  --max-new-tokens MAX_NEW_TOKENS
                        生成トークン上限。長時間音声では大きくする (default: 4096)
  --chunk-seconds CHUNK_SECONDS
                        時刻付け時の長時間音声分割秒数。0で分割しない (default: 240)
  --chunk-overlap CHUNK_OVERLAP
                        チャンク前後の重複秒数。境界は出力に明示 (default: 10)
  --outfile1 OUTFILE1   時刻付き出力ファイル
  --outfile2 OUTFILE2   本文出力ファイル
  --outfile3 OUTFILE3   環境・設定情報JSONファイル
  --pause {0,1}         終了時にENTERを待つか (default: 0)


生成されたデータファイル

(データファイルが見つかりませんでした)

生成された画像一覧

(画像ファイルが見つかりませんでした)