离线语音识别
完全在本机运行的语音 / 音视频转文字桌面客户端,离线识别不上传数据
下载离线语音识别(桌面客户端)
一款完全在本机浏览器里运行的语音 / 音视频转文字工具。所有音频、视频都在你的设备本地解码与识别,不上传、不记录、不用于训练,隐私零泄露。下载压缩包,解压后双击「启动asr.exe」即可使用,无需联网。
LiE2
- 🌐 全离线运行,无需联网、不上传任何数据
- 🎙 支持 Whisper 与 Sherpa-ONNX(Paraformer · SenseVoice)
- 📁 音频、视频文件转写 + 麦克风实时录音转写
- 💻 Windows 桌面客户端,解压即用,不依赖浏览器
✨ 离线语音识别 使用指南
一款完全在本机浏览器里运行的语音 / 音视频转文字工具。所有音频、视频都在你的设备本地解码与识别,不上传、不记录、不用于训练,隐私零泄露。
本说明面向使用者(怎么用)。
一、怎么打开本软件(下载即用,最简单)
你拿到的是一个压缩包,解压后根目录里应当包含这 4 样东西:
| 文件 / 文件夹 | 作用 |
|---|---|
使用说明.txt / 使用说明.md | 本说明文档 |
启动asr.exe | 启动程序,双击它即可运行 |
web_config.json | 可选配置文件(端口 / 监听地址 / 站点目录 / 默认首页),不填也能用 |
dist\ | 网页与识别模型,必须和 exe 放在同一目录 |
操作步骤:
- 双击
启动asr.exe,会弹出一个小窗口(若系统杀软拦截,请将其加入白名单,见第七节)。 - 端口号默认
5666(1–65535 之间都可改,一般不用动)。 - 点 「启动」,程序会在本机启动一个本地网页服务(仅监听
127.0.0.1,不对外网开放)。 - 窗口里出现的网址(如
http://127.0.0.1:5666)点击即可在默认浏览器中打开识别页面。 - 用完后回到小窗口点 「关闭」,或直接关掉窗口即可退出。
⚠️ 关键:
dist文件夹必须和启动asr.exe在同一个目录。如果dist缺失或不在旁边,程序会回退到一个内置的"服务运行中"空白页,识别页面打不开。
想换端口、想让局域网其他设备也能访问、或想换默认首页,编辑
web_config.json即可(见第九节),无需重新编译。
提示:这个 exe 本质是一个"本地小服务器 + 浏览器入口"。部分杀毒软件可能误报,它是安全的——它不联网、不搜集数据,只在你电脑本地开一个网页。如被拦截,请把该文件加入杀软白名单 / 信任区即可。
⚠️ 不能直接双击
index.html打开(file:// 方式)。浏览器会拦截 Web Worker 与模型加载,页面会提示"请改用本地服务器"。请始终通过双击启动asr.exe打开本软件。
二、界面与功能一览
打开页面后,从上到下依次是:
| 区域 | 说明 |
|---|---|
| 引擎 | 选择识别引擎:Whisper(多语种)或 Sherpa-ONNX(中文更强)。 |
| 模型 | 随引擎变化:Whisper 有 Base(快)/ Small(准);Sherpa 有 Paraformer(中文流式·内置)/ SenseVoice Small(多语种·情感检测)。 |
| 识别语言 | 随模型变化:Whisper 支持约 99 种语言(默认中文);Paraformer 仅中文(自动锁定);SenseVoice 支持 自动 + 中/英/日/韩/粤(默认自动检测)。 |
| 音频 / 视频文件 | 点选框或把文件拖进去,支持常见格式(wav/mp3/m4a/webm/ogg/flac/mp4/mov/mkv/avi 等)。 |
| 开始识别 / 停止 | 选好文件后点「开始识别」;识别中可点「停止」。 |
| 🎙 录音 | 用麦克风实时录音并转写(首次需授权麦克风)。 |
| 进度条 | 显示加载模型与识别进度。 |
| 识别结果 | 转写文本,可 复制 / 保存 为文件。 |
| 状态日志 | 底部实时显示加载、识别过程中的提示与报错。 |
三、文件 / 视频转写(最常用)
- 在 引擎 / 模型 / 识别语言 中按需要选择(见下方"怎么选")。
- 点击虚线框 「点击选择,或将音频 / 视频文件拖拽到此处」,选一个音频或视频文件;也可直接把文件拖进框里。
- 文件名会出现在框内,「开始识别」按钮变为可用,点击它。
- 首次使用某引擎会先加载模型(进度条走动,可能要等十几秒到几十秒,取决于模型大小与电脑性能),加载完自动开始识别。
- 识别完成后,文本出现在「识别结果」区,可点 复制 或 保存。
长音频 / 视频会自动分段处理并在结束后做一次整体文字与标点优化,无需手动切分。
四、麦克风录音转写
- 选择引擎与模型(录音推荐
Sherpa-ONNX · Paraformer实时流式,或SenseVoice)。 - 点 🎙 录音,浏览器会请求麦克风权限,允许 后开始聆听(页面顶部出现"正在聆听…"状态条)。
- 说话,文字会实时(Paraformer)或停止后(SenseVoice,见下)出现在结果区。
- 再次点录音按钮(变「停止录音」)结束录音。
关于 SenseVoice 录音:SenseVoice 是离线整段模型,录音时是"先录整段、停止后再一次性识别",所以说话过程中结果区不会实时跳动,停止后才出字——这是正常现象。Paraformer 则是边说边出字。
麦克风用不了? 录音功能依赖"安全上下文",必须用桌面客户端
启动asr.exe打开(http://127.0.0.1),不要用file://直接打开,否则麦克风不可用。
五、引擎 / 模型怎么选
| 场景 | 推荐 |
|---|---|
| 中文语音 / 视频,要快、要实时 | Sherpa-ONNX → Paraformer(中文标点内置,流式) |
| 多语种(含英/日/韩/粤)或想要情感/事件标记 | Sherpa-ONNX → SenseVoice Small(自带标点;语言选「自动」可自动判别语种) |
| 英语等多语种、追求更高准确率 | Whisper → Small(准)/ Base(快) |
- Paraformer:仅中文,下拉语言会被锁定为中文,无需选择。
- SenseVoice:语言下拉出现「自动」,默认识别前自动判断语种;也可手动指定中/英/日/韩/粤。
- Whisper:语言列表最全(约 99 种),默认中文;如选了模型不支持的语言会报错,换回支持的语言即可。
六、识别结果操作
- 复制:把结果区文字复制到剪贴板。
- 保存:把结果保存为文本文件到本地。
七、常见问题(FAQ)
Q1:杀毒软件报病毒 / 风险程序?
A:这是误报。启动asr.exe 只是在你电脑本地开一个网页服务,不联网、不搜集任何数据。可将其加入杀软白名单 / 信任区后正常使用。
Q2:页面提示"请改用本地服务器"或一片空白?
A:你是直接双击 index.html(file://)打开的。请改用桌面客户端 启动asr.exe 双击打开。
Q3:双击 exe 后浏览器打开却是"服务运行中"空白页?
A:多半是 dist 文件夹没有和 exe 放在同一目录(见第一节)。请确认解压后的根目录里 dist\ 和 启动asr.exe 在一起。
Q4:麦克风没法录音 / 没声音?
A:确认已通过 http://127.0.0.1 或 https 访问(非 file://),并在浏览器弹窗中允许了麦克风权限;并检查系统 / 浏览器没有全局禁用该站点麦克风。
Q5:第一次点"开始识别"卡在加载、很慢?
A:首次需要把识别模型加载进内存(Paraformer / SenseVoice 模型较大),属正常。加载一次后会缓存,后续更快。请耐心等待进度条走完。
Q6:识别出错 / 报语言不支持?
A:多半是语言选项和模型不匹配。换回该模型支持的语言(见第五节)再试;若仍报错,把底部「状态日志」里的错误信息发给我们即可定位。
Q7:识别速度慢?
A:识别在浏览器内用 WASM(CPU)计算,速度取决于设备性能。追求速度可选更小的模型(Whisper Base、Paraformer);追求准确率选 Whisper Small。
关于 离线语音识别
离线语音识别 是一款完全在本地运行的语音 / 音视频转文字桌面客户端,无需安装、无需注册。它把识别引擎(Whisper / Sherpa-ONNX)与网页界面打包成一个可双击运行的程序,所有音频、视频的解码与识别都在你的设备本地完成,不依赖云端算力,也不上传任何数据。
隐私与安全
- 所有音频 / 视频的解码与识别都在你本机完成,不经过任何服务器,不发送任何数据。
- 桌面客户端仅在本机
127.0.0.1开启本地服务,不会把服务暴露到局域网或外网(除非你在web_config.json把listen_ip改成0.0.0.0)。 - 页面含一个站长统计脚本(百度统计),仅用于匿名访问量统计,不包含你的任何音频内容。
配置文件 web_config.json(可选)
启动asr.exe 会在自己所在目录(即打包根目录)读取 web_config.json(JSON 格式)。你可以新建 / 修改它来定制启动行为,无需重新编译。
若文件不存在、或某项写错(类型不对 / 超出范围 / 无法解析),该项会自动回退到默认值,其余正确项仍生效——不会影响程序启动。
| 字段 | 类型 | 默认值 | 说明 |
|---|---|---|---|
port | 整数 | 5666 | 监听端口(1–65535)。 |
listen_ip | 字符串 | 127.0.0.1 | 监听地址。127.0.0.1 仅本机;改成 0.0.0.0 可让局域网内其他设备访问。 |
webroot | 字符串 | 空(= exe 同目录的 dist) | 静态站点目录;可用相对路径(相对于 exe 所在目录)或绝对路径。填 "." 表示 exe 所在目录本身。 |
index_pages | 字符串(逗号分隔) | index.html | 默认首页候选,多个用逗号隔开,按顺序尝试首个存在的文件。例如 home.html,index.html 表示优先用 home.html,没有再用 index.html。 |
示例(全部为默认值的写法,放在 exe 同目录即可):
{
"port": 5666,
"listen_ip": "127.0.0.1",
"webroot": "",
"index_pages": "index.html"
}
命令行参数
-dir 路径的优先级高于配置文件里的webroot;其余项以配置文件 / 默认值为准。
为什么选择离线语音识别?
- 🔒 隐私安全:数据本机处理不上传服务器,保障隐私安全更安心。
- ⚡ 免费极速:无需注册登录,打开即用,本地计算零等待。
- 🛠 即开即用:跨平台支持,手机、平板、电脑都能流畅使用。
相关搜索:离线语音识别, 语音转文字, asr, 离线, 语音识别, 转写, 下载, whisper, sherpa
常见问题
- 离线语音识别和网页版有什么不同?
- 它是桌面客户端形态,完全在本机运行 Whisper 与 Sherpa-ONNX 引擎,识别过程不联网、不上传,适合长期离线使用。
- 支持哪些识别引擎?
- 内置 Whisper 与 Sherpa-ONNX 两套方案,可在本地切换;不同引擎对语种、速度与精度的取舍不同。
- 没有网络真的能用吗?
- 能。模型与推理都在本机,断网状态下照常识别,适合内网、出差或涉密环境。
- 长录音、采访稿也能转吗?
- 可以。把音视频交给本地引擎转写,得到文字稿后自行校对,整个过程数据不出设备。
- 识别准确率怎么保证?
- 取决于所选模型规模与音频质量;工具本身只负责本地推理,建议用清晰音源并选更优模型。
- 我的录音会被收集吗?
- 不会。所有音频都在你电脑本地处理,没有任何上传环节。
离线语音识别 能做什么
- 本机运行 Whisper 与 Sherpa-ONNX 转写。
- 支持音视频离线识别为文字。
- 多引擎可切换,不依赖网络。
离线语音识别 适合什么场景
- 内网、涉密或出差无网环境。
- 长录音、访谈稿离线整理。
- 对隐私要求高、拒绝上传音频的场合。