transcribe_qwen3_asr 実行例
help出力 transcribe_qwen3_asr.py --help
usage: transcribe_qwen3_asr.py [-h] [--backend {qwen3-asr}]
[-m {0.6B,1.7B,Qwen/Qwen3-ASR-0.6B,Qwen/Qwen3-ASR-1.7B}]
[-l LANG] [-d DEVICE]
[--dtype {auto,bfloat16,float16,float32}]
[--timestamps {0,1}] [--aligner ALIGNER]
[--attention {auto,sdpa,eager,flash_attention_2}]
[--max-inference-batch-size MAX_INFERENCE_BATCH_SIZE]
[--max-new-tokens MAX_NEW_TOKENS]
[--chunk-seconds CHUNK_SECONDS]
[--chunk-overlap CHUNK_OVERLAP]
[--outfile1 OUTFILE1] [--outfile2 OUTFILE2]
[--outfile3 OUTFILE3] [--pause {0,1}]
infile
Qwen3-ASR音声文字起こしツール(ASRバックエンド拡張対応)
positional arguments:
infile 入力音声ファイル名(glob可)
options:
-h, --help show this help message and exit
--backend {qwen3-asr}
ASRバックエンド (default: qwen3-asr)
-m, --model {0.6B,1.7B,Qwen/Qwen3-ASR-0.6B,Qwen/Qwen3-ASR-1.7B}
Qwen3-ASRモデル (default: 0.6B)
-l, --lang LANG 言語コード/名称。autoまたは空文字で自動判定 (default: ja)
-d, --device DEVICE auto, cpu, cuda, cuda:0など (default: auto)
--dtype {auto,bfloat16,float16,float32}
推論精度 (default: auto)
--timestamps {0,1} ForcedAlignerで時刻を付けるか (default: 1)
--aligner ALIGNER 時刻推定モデル
--attention {auto,sdpa,eager,flash_attention_2}
Attention実装 (default: auto)
--max-inference-batch-size MAX_INFERENCE_BATCH_SIZE
推論バッチ上限。小さい値はVRAMを節約 (default: 1)
--max-new-tokens MAX_NEW_TOKENS
生成トークン上限。長時間音声では大きくする (default: 4096)
--chunk-seconds CHUNK_SECONDS
時刻付け時の長時間音声分割秒数。0で分割しない (default: 240)
--chunk-overlap CHUNK_OVERLAP
チャンク前後の重複秒数。境界は出力に明示 (default: 10)
--outfile1 OUTFILE1 時刻付き出力ファイル
--outfile2 OUTFILE2 本文出力ファイル
--outfile3 OUTFILE3 環境・設定情報JSONファイル
--pause {0,1} 終了時にENTERを待つか (default: 0)
生成されたデータファイル
(データファイルが見つかりませんでした)
生成された画像一覧
(画像ファイルが見つかりませんでした)