音视频工具

离线语音识别

完全在本机运行的语音 / 音视频转文字桌面客户端,离线识别不上传数据

完全离线 · 隐私零泄露

下载离线语音识别(桌面客户端)

一款完全在本机浏览器里运行的语音 / 音视频转文字工具。所有音频、视频都在你的设备本地解码与识别,不上传、不记录、不用于训练,隐私零泄露。下载压缩包,解压后双击「启动asr.exe」即可使用,无需联网。

提取码 LiE2
  • 🌐 全离线运行,无需联网、不上传任何数据
  • 🎙 支持 Whisper 与 Sherpa-ONNX(Paraformer · SenseVoice)
  • 📁 音频、视频文件转写 + 麦克风实时录音转写
  • 💻 Windows 桌面客户端,解压即用,不依赖浏览器

✨ 离线语音识别 使用指南

一款完全在本机浏览器里运行的语音 / 音视频转文字工具。所有音频、视频都在你的设备本地解码与识别,不上传、不记录、不用于训练,隐私零泄露。

本说明面向使用者(怎么用)。

一、怎么打开本软件(下载即用,最简单)

你拿到的是一个压缩包,解压后根目录里应当包含这 4 样东西:

文件 / 文件夹作用
使用说明.txt / 使用说明.md本说明文档
启动asr.exe启动程序,双击它即可运行
web_config.json可选配置文件(端口 / 监听地址 / 站点目录 / 默认首页),不填也能用
dist\网页与识别模型,必须和 exe 放在同一目录

操作步骤:

  1. 双击 启动asr.exe,会弹出一个小窗口(若系统杀软拦截,请将其加入白名单,见第七节)。
  2. 端口号默认 5666(1–65535 之间都可改,一般不用动)。
  3. 「启动」,程序会在本机启动一个本地网页服务(仅监听 127.0.0.1,不对外网开放)。
  4. 窗口里出现的网址(如 http://127.0.0.1:5666)点击即可在默认浏览器中打开识别页面。
  5. 用完后回到小窗口点 「关闭」,或直接关掉窗口即可退出。

⚠️ 关键: dist 文件夹必须和 启动asr.exe 在同一个目录。如果 dist 缺失或不在旁边,程序会回退到一个内置的"服务运行中"空白页,识别页面打不开。

想换端口、想让局域网其他设备也能访问、或想换默认首页,编辑 web_config.json 即可(见第九节),无需重新编译

提示:这个 exe 本质是一个"本地小服务器 + 浏览器入口"。部分杀毒软件可能误报,它是安全的——它不联网、不搜集数据,只在你电脑本地开一个网页。如被拦截,请把该文件加入杀软白名单 / 信任区即可。

⚠️ 不能直接双击 index.html 打开(file:// 方式)。浏览器会拦截 Web Worker 与模型加载,页面会提示"请改用本地服务器"。请始终通过双击 启动asr.exe 打开本软件。

二、界面与功能一览

打开页面后,从上到下依次是:

区域说明
引擎选择识别引擎:Whisper(多语种)或 Sherpa-ONNX(中文更强)。
模型随引擎变化:Whisper 有 Base(快)/ Small(准);Sherpa 有 Paraformer(中文流式·内置)/ SenseVoice Small(多语种·情感检测)。
识别语言随模型变化:Whisper 支持约 99 种语言(默认中文);Paraformer 仅中文(自动锁定);SenseVoice 支持 自动 + 中/英/日/韩/粤(默认自动检测)。
音频 / 视频文件点选框或把文件拖进去,支持常见格式(wav/mp3/m4a/webm/ogg/flac/mp4/mov/mkv/avi 等)。
开始识别 / 停止选好文件后点「开始识别」;识别中可点「停止」。
🎙 录音用麦克风实时录音并转写(首次需授权麦克风)。
进度条显示加载模型与识别进度。
识别结果转写文本,可 复制 / 保存 为文件。
状态日志底部实时显示加载、识别过程中的提示与报错。

三、文件 / 视频转写(最常用)

  1. 引擎 / 模型 / 识别语言 中按需要选择(见下方"怎么选")。
  2. 点击虚线框 「点击选择,或将音频 / 视频文件拖拽到此处」,选一个音频或视频文件;也可直接把文件拖进框里。
  3. 文件名会出现在框内,「开始识别」按钮变为可用,点击它。
  4. 首次使用某引擎会先加载模型(进度条走动,可能要等十几秒到几十秒,取决于模型大小与电脑性能),加载完自动开始识别。
  5. 识别完成后,文本出现在「识别结果」区,可点 复制保存

长音频 / 视频会自动分段处理并在结束后做一次整体文字与标点优化,无需手动切分。

四、麦克风录音转写

  1. 选择引擎与模型(录音推荐 Sherpa-ONNX · Paraformer 实时流式,或 SenseVoice)。
  2. 🎙 录音,浏览器会请求麦克风权限,允许 后开始聆听(页面顶部出现"正在聆听…"状态条)。
  3. 说话,文字会实时(Paraformer)或停止后(SenseVoice,见下)出现在结果区。
  4. 再次点录音按钮(变「停止录音」)结束录音。

关于 SenseVoice 录音:SenseVoice 是离线整段模型,录音时是"先录整段、停止后再一次性识别",所以说话过程中结果区不会实时跳动,停止后才出字——这是正常现象。Paraformer 则是边说边出字。

麦克风用不了? 录音功能依赖"安全上下文",必须用桌面客户端 启动asr.exe 打开(http://127.0.0.1),不要用 file:// 直接打开,否则麦克风不可用。

五、引擎 / 模型怎么选

场景推荐
中文语音 / 视频,要快、要实时Sherpa-ONNXParaformer(中文标点内置,流式)
多语种(含英/日/韩/粤)或想要情感/事件标记Sherpa-ONNXSenseVoice Small(自带标点;语言选「自动」可自动判别语种)
英语等多语种、追求更高准确率WhisperSmall(准)/ Base(快)
  • Paraformer:仅中文,下拉语言会被锁定为中文,无需选择。
  • SenseVoice:语言下拉出现「自动」,默认识别前自动判断语种;也可手动指定中/英/日/韩/粤。
  • Whisper:语言列表最全(约 99 种),默认中文;如选了模型不支持的语言会报错,换回支持的语言即可。

六、识别结果操作

  • 复制:把结果区文字复制到剪贴板。
  • 保存:把结果保存为文本文件到本地。

七、常见问题(FAQ)

Q1:杀毒软件报病毒 / 风险程序?

A:这是误报启动asr.exe 只是在你电脑本地开一个网页服务,不联网、不搜集任何数据。可将其加入杀软白名单 / 信任区后正常使用。

Q2:页面提示"请改用本地服务器"或一片空白?

A:你是直接双击 index.html(file://)打开的。请改用桌面客户端 启动asr.exe 双击打开。

Q3:双击 exe 后浏览器打开却是"服务运行中"空白页?

A:多半是 dist 文件夹没有和 exe 放在同一目录(见第一节)。请确认解压后的根目录里 dist\启动asr.exe 在一起。

Q4:麦克风没法录音 / 没声音?

A:确认已通过 http://127.0.0.1https 访问(非 file://),并在浏览器弹窗中允许了麦克风权限;并检查系统 / 浏览器没有全局禁用该站点麦克风。

Q5:第一次点"开始识别"卡在加载、很慢?

A:首次需要把识别模型加载进内存(Paraformer / SenseVoice 模型较大),属正常。加载一次后会缓存,后续更快。请耐心等待进度条走完。

Q6:识别出错 / 报语言不支持?

A:多半是语言选项和模型不匹配。换回该模型支持的语言(见第五节)再试;若仍报错,把底部「状态日志」里的错误信息发给我们即可定位。

Q7:识别速度慢?

A:识别在浏览器内用 WASM(CPU)计算,速度取决于设备性能。追求速度可选更小的模型(Whisper Base、Paraformer);追求准确率选 Whisper Small。

关于 离线语音识别

离线语音识别 是一款完全在本地运行的语音 / 音视频转文字桌面客户端,无需安装、无需注册。它把识别引擎(Whisper / Sherpa-ONNX)与网页界面打包成一个可双击运行的程序,所有音频、视频的解码与识别都在你的设备本地完成,不依赖云端算力,也不上传任何数据。

隐私与安全

  • 所有音频 / 视频的解码与识别都在你本机完成,不经过任何服务器,不发送任何数据。
  • 桌面客户端仅在本机 127.0.0.1 开启本地服务,不会把服务暴露到局域网或外网(除非你在 web_config.jsonlisten_ip 改成 0.0.0.0)。
  • 页面含一个站长统计脚本(百度统计),仅用于匿名访问量统计,不包含你的任何音频内容。

配置文件 web_config.json(可选)

启动asr.exe 会在自己所在目录(即打包根目录)读取 web_config.json(JSON 格式)。你可以新建 / 修改它来定制启动行为,无需重新编译

若文件不存在、或某项写错(类型不对 / 超出范围 / 无法解析),该项会自动回退到默认值,其余正确项仍生效——不会影响程序启动。

字段类型默认值说明
port整数5666监听端口(1–65535)。
listen_ip字符串127.0.0.1监听地址。127.0.0.1 仅本机;改成 0.0.0.0 可让局域网内其他设备访问。
webroot字符串空(= exe 同目录的 dist静态站点目录;可用相对路径(相对于 exe 所在目录)或绝对路径。填 "." 表示 exe 所在目录本身。
index_pages字符串(逗号分隔)index.html默认首页候选,多个用逗号隔开,按顺序尝试首个存在的文件。例如 home.html,index.html 表示优先用 home.html,没有再用 index.html

示例(全部为默认值的写法,放在 exe 同目录即可):

{
  "port": 5666,
  "listen_ip": "127.0.0.1",
  "webroot": "",
  "index_pages": "index.html"
}

命令行参数 -dir 路径 的优先级高于配置文件里的 webroot;其余项以配置文件 / 默认值为准。

为什么选择离线语音识别?

  • 🔒 隐私安全:数据本机处理不上传服务器,保障隐私安全更安心。
  • ⚡ 免费极速:无需注册登录,打开即用,本地计算零等待。
  • 🛠 即开即用:跨平台支持,手机、平板、电脑都能流畅使用。

相关搜索:离线语音识别, 语音转文字, asr, 离线, 语音识别, 转写, 下载, whisper, sherpa

常见问题

离线语音识别和网页版有什么不同?
它是桌面客户端形态,完全在本机运行 Whisper 与 Sherpa-ONNX 引擎,识别过程不联网、不上传,适合长期离线使用。
支持哪些识别引擎?
内置 Whisper 与 Sherpa-ONNX 两套方案,可在本地切换;不同引擎对语种、速度与精度的取舍不同。
没有网络真的能用吗?
能。模型与推理都在本机,断网状态下照常识别,适合内网、出差或涉密环境。
长录音、采访稿也能转吗?
可以。把音视频交给本地引擎转写,得到文字稿后自行校对,整个过程数据不出设备。
识别准确率怎么保证?
取决于所选模型规模与音频质量;工具本身只负责本地推理,建议用清晰音源并选更优模型。
我的录音会被收集吗?
不会。所有音频都在你电脑本地处理,没有任何上传环节。

离线语音识别 能做什么

  • 本机运行 Whisper 与 Sherpa-ONNX 转写。
  • 支持音视频离线识别为文字。
  • 多引擎可切换,不依赖网络。

离线语音识别 适合什么场景

  • 内网、涉密或出差无网环境。
  • 长录音、访谈稿离线整理。
  • 对隐私要求高、拒绝上传音频的场合。