無料 音声テキスト変換・音声文字起こしツール - 完全ローカルAI音声認識

GPU 加速を検出中...

完全無料・サーバー送信なしのブラウザ内完結型音声文字起こしツール。MP3/M4A/WAV などの声や録音データを端末のGPUで高速処理し、SRT字幕やWord文書に出力します。

📁

クリックまたは音声・動画ファイルをここにドラッグ&ドロップ

MP3, WAV, M4A, AAC, OGG, WebM, MP4, MOV 等に対応

サンプルでテスト:

100% ブラウザ完結・オフライン音声&動画文字起こし

機密情報やプライバシー、動画字幕作成に最適。登録不要・完全無料。音声や動画ファイルが外部サーバーに送信されることは一切なく、お使いの端末(GPU / CPU)上で直接 AI 推論を実行します。

🔒
100% ローカル完結のプライバシー保護データはブラウザメモリ内でのみ処理されます。インターネット未接続(オフライン)でも安心して使用可能。
WebGPU ハードウェア高速化端末の GPU 性能を活用して高速に処理。非対応環境では自動的に WASM へフォールバックします。
🎬
音声・動画フォーマット直接対応MP4/MOV/WebM 動画や M4A/MP3/WAV 音声をそのままドラッグ&ドロップするだけで音声を自動抽出。
📑
多彩な字幕&ドキュメント出力Premiere Pro や CapCut にそのまま読み込める SRT/VTT 字幕、Notion/Obsidian 向け Markdown、Word に一括出力。

使い方

1

ファイルを選択またはドロップ

音声 (MP3/M4A/WAV) または動画 (MP4/MOV) をアップロードすると、自動的に音声トラックがデコードされます。

2

モデルと言語を選択

標準は Base モデルがおすすめ。スマホでは Tiny、高精度な認識には Small を選択できます。

3

文字起こしを実行

開始ボタンをクリック。モデルはブラウザの IndexedDB にキャッシュされ、次回以降はオフラインで即座に起動します。

4

コピーまたはファイル出力

タイムスタンプ付きのテキストを確認し、ワンクリックでコピーまたは SRT、Word、Markdown 形式で保存。

トラブルシューティング

スマホ等のメモリ不足 (OOM)

スマートフォンのブラウザはメモリ制限が厳しいため、Tiny または Base モデルのご利用を推奨します。

WebGPU の動作状況

Chrome / Edge 113+ および最新の Safari で WebGPU が有効になります。非対応環境では自動的に WASM で動作します。

無音・BGM による誤認識(ハルシネーション)

長時間の無音区間や音楽のみの部分で同じ単語が繰り返される場合があります。人の声が明瞭な音声をお使いください。

特殊な動画コーデックの読み込み失敗

一部の非標準的な動画形式で読み込みに失敗する場合は、あらかじめ M4A または MP3 に変換してお試しください。

オープンソースモデルと技術の出典・根拠

信頼性の高いオープンソースモデルと公式推論フレームワークに基づいて構築されており、すべてのコード・モデル・動作は公開され検証可能です。

OpenAI Official

OpenAI Whisper 公式アーキテクチャ

OpenAI が公開している公式 Whisper 音声認識モデル (MIT ライセンス) を採用し、高精度な多言語認識とタイムスタンプ打刻を実現。

OpenAI Whisper 公式 GitHub リポジトリ →
Hugging Face

Hugging Face Transformers.js

Hugging Face 公式が提供する WebGPU / WASM ブラウザ推論エンジン (Apache-2.0 ライセンス) により、端末上で高速動作します。

Transformers.js 公式ドキュメント →
ONNX Community

ONNX Community 公式重みファイル

Tiny、Base、Small モデルはすべて Hugging Face 公式の onnx-community リポジトリから直接配信され、改ざんのない安全な重みを使用。

100% Client-Side

100% ローカル処理の検証性

ブラウザの開発者ツール (F12 → Network タブ) でいつでも通信内容をご確認いただけます。モデルの初回取得以外、音声・動画・テキストデータが外部に送信されることは一切ありません。

よくある質問と技術解説

なぜ 100% オフラインで安全なのですか?

Hugging Face Transformers.js と ONNX Runtime Web を使用し、OpenAI Whisper モデルをお使いのブラウザ上で直接実行します。データが外部サーバーに送信されることはありません。

MP4 や MOV 動画から直接字幕を書き出せますか?

はい。ブラウザ標準の Web Audio API を使用して動画ファイルから音声トラックを直接デコードするため、事前の動画変換は不要です。

毎回モデルをダウンロードする必要がありますか?

いいえ。初回読み込み時にブラウザの IndexedDB / CacheStorage に保存されるため、2回目以降は通信不要で高速起動します。

どの出力形式に対応していますか?

CapCut や Premiere Pro で使える .srt 字幕、.vtt 字幕、.docx Word 文書、.md Markdown ノート、.txt テキスト、.json 生データ、印刷用 PDF 出力に対応しています。

Tiny、Base、Small モデルの違いは何ですか?

各モデルのパラメータ数、ファイル容量、推奨デバイスの比較は以下の通りです:

Whisper モデルパラメータ数容量推奨デバイス・用途
Tiny (多言語) ↗39M約 41 MBスマートフォン、短いメモ、高速プレビュー
Base (多言語 / 標準) ↗74M約 77 MB標準推奨:速度と精度のバランス型、日本語・英語対応
Small (多言語) ↗244M約 249 MB高性能デスクトップ PC + WebGPU 加速