免費語音轉文字/音訊轉文字工具 - 本地AI聲音辨識與字幕生成

正在檢測硬體加速...

專為注重隱私安全與免費轉寫的使用者打造的純本地聲音與語音轉文字工具。支援 MP3、M4A、WAV 等錄音與音訊格式,100% 瀏覽器離線辨識,一鍵匯出 SRT、Word、TXT、Markdown。

📁

點擊上傳或將音訊/影片檔案拖曳至此處

支援 MP3, WAV, M4A, AAC, OGG, WebM, MP4, MOV 等格式

快速測試:

100% 瀏覽器本地離線音視頻轉文字

專為對隱私安全、格式相容性及免費離線有極高要求的使用者打造。無需註冊登入,音訊與影片檔案絕不離開您的裝置,直接利用電腦/手機本地算力完成高品質 AI 語音識別。

🔒
100% 本地隱私安全檔案與文字均在瀏覽器本地記憶體處理,斷網亦可順暢運行,從根源杜絕資料洩露
WebGPU 顯示卡硬體加速優先調用裝置獨立/整合 GPU 算力,大幅提升轉寫速度;不支援時自動平滑回退至 WASM
🎬
音視頻格式全相容無需手動轉碼,MP4/MOV/WebM 影片與 MP3/M4A/WAV 音訊直接拖入即可自動串流擷取音軌
📑
全格式字幕與筆記匯出一鍵匯出剪映/PR標準 SRT 字幕、Notion/Obsidian Markdown 筆記、Word 文件及純文字

如何使用

1

選擇或拖入檔案

上傳您的音訊 (MP3/M4A/WAV) 或影片 (MP4/MOV) 檔案,系統自動完成音軌擷取

2

選擇模型與語言

預設推薦 Base 平衡模型;手機端建議選 Tiny;桌面高畫質可選擇 Small

3

啟動本地推論

點擊開始轉錄,模型首次自動快取到瀏覽器 IndexedDB,後續離線秒開

4

複製或匯出檔案

在結果面板即時預覽分段文字,可一鍵複製或匯出為 SRT、Word、Markdown

排錯與避坑清單

手機端或低配設備記憶體溢出 (OOM)

行動端瀏覽器可用記憶體有限,強烈建議選用 Tiny 或 Base 模型;避免在手機端載入 Small 高畫質模型。

WebGPU 狀態與硬體加速支援

Chrome/Edge 113+ 及現代 Safari 預設支援 WebGPU。如遇顯卡驅動限制,工具會自動降級為 WASM 模式運行。

背景音樂或長時間靜音產生重複幻覺

Whisper 在處理大段靜音或純音樂時可能輸出重複文字,建議盡量輸入人聲清晰的錄音檔案。

特殊影片編碼無法解析

若極少數非標編碼影片無法在瀏覽器解碼,可先用手機自帶工具匯出為 M4A/MP3 音訊後再上傳。

開源模型與技術溯源

本工具嚴格基於權威開源模型與官方推論框架構建,所有程式碼、模型權重與執行邏輯完全公開透明、可審計。

OpenAI Official

OpenAI Whisper 官方核心

採用 OpenAI 官方開源的 Whisper 語音辨識模型架構 (MIT 授權),具備超強多語言通用辨識與時間戳記對齊能力。

OpenAI Whisper 官方 GitHub 倉庫 →
Hugging Face

Hugging Face Transformers.js

由 Hugging Face 官方維護的 WebGPU / WASM 瀏覽器端深度學習推論引擎 (Apache-2.0 授權),保障本地流暢推論。

Transformers.js 官方文件與開源程式碼 →
ONNX Community

ONNX Community 官方權重源

Tiny、Base 與 Small 均直接採用 Hugging Face 官方 onnx-community 倉庫標準多語言權重,杜絕任何第三方篡改。

100% Client-Side

100% 用戶端隱私可驗證聲明

您可隨時按 F12 開啟瀏覽器開發者工具 (Network 面板) 進行封包審計:除首次下載模型檔案外,整個音視頻轉寫過程中絕無任何音訊、影片或文字資料向外部伺服器傳輸。

常見問題與技術原理

本工具是如何實現 100% 離線隱私安全的?

本站基於 Hugging Face Transformers.js 和 ONNX Runtime Web 技術,直接將 OpenAI Whisper AI 模型下載到您的瀏覽器快取中並在本地硬體(GPU / CPU)上執行推論。您的音視頻檔案不會上傳到任何伺服器,斷網狀態下依然可以完整使用,徹底杜絕資料洩露風險。

可以直接擷取 MP4 / MOV 影片裡的文案字幕嗎?

可以。本工具內建了基於瀏覽器 Web Audio API 的音軌解碼管道,無需您手動用格式工廠等軟體轉碼。無論是 MP4、MOV、WebM 影片,還是 M4A 手機錄音、MP3 播客,都可以直接拖入擷取文案與產生字幕。

第一次使用需要下載模型,後續還會耗費流量嗎?

不會。模型在首次下載後會自動儲存在瀏覽器的 CacheStorage / IndexedDB 本地資料庫中。後續再次造訪或轉錄時直接從本機磁碟秒級載入,無需重複消耗流量。

支援匯出哪些格式?可以直接匯入剪映嗎?

支援匯出標準 .srt 字幕檔案(可直接匯入剪映、PR、Final Cut Pro、CapCut)、.vtt 字幕、.docx Word 會議紀要文件、.md Markdown 筆記、.txt 純文字/時間戳記文字以及 .json 原始資料,同時支援原生列印為排版整潔的 PDF。

Tiny、Base、Small 三個模型有什麼區別?

不同模型的參數量、下載體積與硬體要求對比如下:

Whisper 模型參數量下載體積推薦設備與場景
Tiny (多語言) ↗39M約 41 MB手機行動端、短錄音、極速預覽
Base (多語言/預設) ↗74M約 77 MB通用推薦,速度與準確率平衡,支援普通話/國語
Small (多語言) ↗244M約 249 MB桌面端高效能電腦 + WebGPU 硬體加速