無料 動画テキスト変換・動画文字起こしツール - MP4/MOV からSRT字幕を自動生成

ハードウェアアクセラレーションを検出中...

100%完全無料の動画テキスト変換&字幕生成ツール (Video to Text)。OpenAI Whisper と WebGPU を搭載し、大容量 MP4/MOV 動画をアップロード不要でローカル高速文字起こし。SRT・VTT字幕や Word・Markdown を即時出力。

🎬

動画・音声ファイルをクリックして選択またはドラッグ&ドロップ

MP4, MOV, WebM, MKV, AVI, MP3, M4A など主要メディア形式に完全対応

サンプルでテスト:
🔒100% 浏览器本地流式提取音轨 · 无需上传数 GB 大视频 · 零带宽损耗

なぜ100%完全ローカルの動画文字起こしが選ばれるのか?

従来のクラウドサービスが抱える「アップロードが遅い・ファイル容量制限・高額な月額課金・動画流出リスク」を完全解決。数GBの動画でもアップロード不要で、端末のGPUを活用して瞬時に字幕を生成します。

🚀
大容量動画もアップロード不要数GBの4K動画でも音声のみをブラウザ内で瞬時に抽出。通信量を消費せず快適に動作
WebGPU による高速GPU推論お使いのパソコンのGPUを活用し、従来のCPU処理と比較して5〜10倍の高速文字起こしを実現
🎬
動画編集用 SRT 字幕を即時出力CapCut、Premiere Pro、DaVinci Resolve に直接ドラッグ&ドロップできる標準SRT字幕を作成
🔒
未公開動画・社内会議の機密保持動画ファイルもテキストデータも端末外へ送信されず、オフライン環境でも安全に動作

動画文字起こし&字幕生成の使い方

1

動画ファイルを選択またはドラッグ

MP4、MOV、WebM、MKV などの動画をエリアにドラッグすると、ブラウザが自動的に音声をローカル抽出します。

2

言語とモデルを選択

精度と速度のバランスに優れた標準の Whisper Base モデルがおすすめです。

3

端末内で文字起こし開始

「字幕とテキストを抽出」をクリックすると、ブラウザのWorker上でタイムスタンプ付き字幕が生成されます。

4

SRT字幕またはWordを出力

動画編集用の .srt 字幕、Markdown ノート、Word 文書、テキストファイルをワンクリックでダウンロード。

動画文字起こしに関するヒントとFAQ

4Kなどの大容量動画でブラウザが重くなりませんか?

問題ありません。Web Audio API により音声ストリームのみを抽出して処理するため、映像部分はメモリを圧迫しません。

初回の読み込みに時間がかかる理由は?

初回実行時のみ Whisper モデルをダウンロードします。完了後はブラウザに保存され、2回目以降はオフラインで即起動します。

出力された SRT 字幕は編集ソフトでズレませんか?

Whisper の高精度な音声区間検出とミリ秒単位のタイムスタンプにより、Premiere Pro や CapCut で正確に同期します。

専門用語や複数人の対話の精度を上げるには?

モデル選択で高精度な Whisper Small モデルを選択すると、語彙力と認識率がさらに向上します。

オープンソースモデルと技術の出典・根拠

信頼性の高いオープンソースモデルと公式推論フレームワークに基づいて構築されており、すべてのコード・モデル・動作は公開され検証可能です。

OpenAI Official

OpenAI Whisper 公式アーキテクチャ

OpenAI が公開している公式 Whisper 音声認識モデル (MIT ライセンス) を採用し、高精度な多言語認識とタイムスタンプ打刻を実現。

OpenAI Whisper 公式 GitHub リポジトリ →
Hugging Face

Hugging Face Transformers.js

Hugging Face 公式が提供する WebGPU / WASM ブラウザ推論エンジン (Apache-2.0 ライセンス) により、端末上で高速動作します。

Transformers.js 公式ドキュメント →
ONNX Community

ONNX Community 公式重みファイル

Tiny、Base、Small モデルはすべて Hugging Face 公式の onnx-community リポジトリから直接配信され、改ざんのない安全な重みを使用。

100% Client-Side

100% ローカル処理の検証性

ブラウザの開発者ツール (F12 → Network タブ) でいつでも通信内容をご確認いただけます。モデルの初回取得以外、音声・動画・テキストデータが外部に送信されることは一切ありません。

動画テキスト変換のよくある質問 (FAQ)

Whisper とは?なぜ動画の文字起こしに最適なのか?

Whisper は OpenAI が開発した多言語音声認識モデルです。68万時間の膨大な音声データで学習されており、動画内のBGMや雑音を自動除去して高精度にテキスト化します。

動画ファイルをアップロードせずに処理できる仕組みは?

ブラウザの Web Audio API を活用し、ローカルで動画コンテナから音声ストリームのみを 16kHz Float32 配列にデコードして Whisper に渡しています。

オフラインキャッシュの仕組みについて

一度読み込んだ AI モデルはブラウザの Cache Storage に安全に保存され、次回以降はネット接続なしでも利用可能です。

出力した SRT 字幕を編集ソフトに取り込む方法

出力される .srt ファイルは標準のタイムコード形式です。ファイルをそのまま CapCut や Premiere Pro のタイムラインに配置するだけで字幕が配置されます。

動画文字起こしにおける Whisper モデルの比較

動画の長さとパソコンの性能に合わせて最適なモデルを選択してください:

モデルパラメータ数INT8 容量推奨用途
Whisper Tiny ↗39M41 MBスマホ利用、長尺動画の構成確認
Whisper Base (推奨) ↗74M77 MB標準推奨、動画字幕作成のベストバランス
Whisper Small ↗244M237 MB高画質対談・学術セミナー・高精度字幕