常见问题
安装、模型、GPU 与故障排查。找不到答案?去 GitHub Issues 提问。
如何让 AI 功能完全跑在本地?Ollama 图文配置教程(Windows / macOS)
ASRbox 的 AI 校对、字幕翻译和对话功能需要一个 LLM(大语言模型)。用在线服务需要注册账号、按量付费,字幕文本也会发送给第三方;而通过 Ollama 把模型跑在你自己的电脑上,免费、离线、文本不出本机。全程大约 15 分钟,跟着下面的步骤做即可。
第 1 步:下载并安装 Ollama
打开 Ollama 官网下载页,按你的系统选择 macOS 或 Windows 版本下载安装:
安装完成后启动 Ollama——macOS 在菜单栏、Windows 在系统托盘会出现小羊驼图标,表示服务已在后台运行。然后在终端(Windows 用 PowerShell)验证安装:
ollama --version 网络提示(国内用户重要)
ollama.com 官网和模型仓库在国内访问不稳定,强烈建议全程在科学上网环境下进行。网页下载走浏览器代理即可;在终端拉取模型时需要单独让命令行走代理(端口换成你自己代理工具的端口):
HTTPS_PROXY=http://127.0.0.1:7897 ollama pull qwen3:4b $env:HTTPS_PROXY="http://127.0.0.1:7897"; ollama pull qwen3:4b 第 2 步:按显存 / 内存选择模型
打开 qwen3 的模型页可以看到每个型号的下载体积(见下方图 2)。给 ASRbox 做字幕校对和翻译,4b~8b 已经很够用;字幕很长、或者常用对话功能分析整份字幕,建议 8b 起步。参考下表按硬件选择:
| 型号 | 下载体积 | 建议配置 | 说明 |
|---|---|---|---|
| qwen3:1.7b | 1.4 GB | 8 GB 内存 | 能跑即可,质量一般,适合先试试水 |
| qwen3:4b | 2.5 GB | 16 GB 内存 / 4 GB+ 显存 | 轻量推荐:256K 长上下文,速度快 |
| qwen3:8b | 5.2 GB | 16~24 GB 内存 / 8 GB 显存 | 质量与速度最平衡,多数人的选择 |
| qwen3:14b | 9.3 GB | 32 GB 内存 / 12 GB 显存 | 更高质量,速度明显变慢 |
| qwen3:30b | 19 GB | 48 GB+ 内存 / 16 GB+ 显存 | 高端机尝鲜,非必需 |
Windows 看显卡显存;macOS 是统一内存,模型大约只能用到内存的一半(其余要留给系统)。模型越大越聪明但也越慢——"改错字、做翻译"这种活并不需要很大的模型。
第 3 步:拉取模型
在终端执行(以 qwen3:4b 为例,追求更准换成 qwen3:8b 即可):
ollama pull qwen3:4b 下载完成后,用这个命令查看本机已安装的模型:
ollama list
下载支持断点续传,中途失败重新执行同一条命令即可,不会从头再来。
第 4 步:在 ASRbox 中一键接入
- 1 保持 Ollama 在后台运行(菜单栏 / 托盘有小羊驼图标),打开 ASRbox 的"设置 → AI LLM 提供商",点击"新增 LLM 提供商"。
- 2 "厂商预设"选择 Ollama:地址会自动填好 http://localhost:11434/v1,密钥留空——本地服务不需要密钥。
- 3 点击"拉取模型":下拉框会直接列出你电脑上已安装的全部模型,点选想要的那个(比如 qwen3:4b)即可,不用手动输入模型 ID。
- 4 点击"创建",ASRbox 会自动测试连接;提供商卡片上出现"本地端点"徽章,就说明配置成功了。
之后在 AI 校对、字幕翻译、对话中选择这个提供商,即可全程离线使用。Docker 版注意:在容器里访问宿主机的 Ollama,要把地址改成 http://host.docker.internal:11434/v1,不能用 localhost。
我的电脑能运行 ASRbox 吗?
桌面版支持 Windows 10 / 11(64 位)和 macOS(Apple Silicon,M1 及之后的芯片)。8 GB 内存可以起步使用小模型;想用 large 级别大模型、或同时跑 AI 校对翻译,建议 16 GB 以上。Windows 有 NVIDIA 显卡的话,还可以在应用内一键安装 CUDA 套件大幅提速。
也提供 Docker Web 版,需要 Linux 环境、8 GB 内存与 15 GB 磁盘,适合部署在自己的服务器上给多人使用。暂时没有 Linux 桌面版与 Intel Mac 版。
macOS 提示"应用已损坏,无法打开"怎么办?
这并不是真的损坏。ASRbox 是免费开源软件,没有购买苹果的开发者签名证书,macOS 对来源陌生的应用就会给出这个默认提示,个人开发者的应用普遍如此。
两种解决方法任选:① 把 ASRbox 拖进"应用程序"文件夹后,打开"终端"执行 xattr -cr /Applications/ASRbox.app,再重新打开;② 先正常打开一次(会报错),然后去"系统设置 → 隐私与安全性",在页面底部的安全性一栏点击"仍要打开"。不放心的话,可以先用下载页提供的 SHA256SUMS.txt 核对安装包完整性。
Windows 安装时 SmartScreen 拦截怎么办?
在蓝色的提示窗口中点击"更多信息",然后选择"仍要运行"即可正常安装。这个提示是因为 ASRbox 暂未购买代码签名证书,新发布、下载量不大的应用都会经历这个阶段,并不代表软件有问题。
谨慎起见,安装前可以用下载页的 SHA256SUMS.txt 核对安装包:在下载目录打开终端执行 certutil -hashfile 文件名 SHA256,与校验文件中的值一致就可以放心安装。
转写速度怎么样?
主要取决于模型大小和硬件:小模型(base / small)快而粗略,大模型(large-v3 系列)慢而准确。日常几分钟的音频,用小模型通常几十秒就能完成;large-v3-turbo 在质量和速度之间比较均衡,是多数人的日常选择。
硬件方面:Windows 安装 NVIDIA CUDA 套件后最高提速约 10 倍("设置 → 加速"里一键安装);macOS 自动使用 Apple GPU,无需任何配置。纯 CPU 也能跑,只是大模型会慢一些。
模型下载很慢或失败?
模型托管在 Hugging Face 与 ModelScope。国内网络访问 Hugging Face 可能较慢,可以在设置中把下载源切换到 ModelScope,或为应用配置代理。
下载支持暂停与断点续传,中断后继续即可,已完成的部分不会重新下载。大模型体积有好几个 GB,进度条看似不动时其实是在写入分片,请耐心等待。
在线 ASR / AI 功能会把我的音频发出去吗?
本地转写全程离线,媒体文件不会离开你的电脑。只有你主动选择"在线 ASR"提供商时,音频才会发送给你自己选的那家服务商。
AI 校对、翻译与对话只发送字幕文本和有限的相邻上下文,绝不发送音频、文件名或本地路径。想让 AI 功能也完全不出本机,可以按上面的教程接入本地 Ollama。更多细节见隐私说明。
如何更新到新版?
应用内"设置 → 关于"可以检查更新,可选稳定版 / 预览版通道。检测到新版后会下载安装包并在应用内校验 SHA256,然后提示你手动安装。
也可以随时在本站下载页或 GitHub Releases 下载最新安装包直接覆盖安装,任务、字幕版本和设置都会保留。
转写结果不准确怎么办?
依次尝试:换更大的模型(如 large-v3-turbo,准确率明显提升但更慢);确认转写语言选对了,方言或中英混杂可以试试"自动";优先使用 Faster Whisper 系列模型,它带词级时间戳,方便对照音频定位错误。
转写完成后还可以用"AI → 字幕核对"让 LLM 再检查一遍,错字、漏字会给出可直接套用的修改建议;本地 Ollama 和在线模型都可以做这一步。
Docker 版能访问 GPU 吗?
当前 Docker 镜像面向 Linux CPU 环境,暂未内置 GPU 支持。需要 GPU 加速请使用 Windows 或 macOS 桌面版。
路线图
ASRbox 由个人开发者在业余时间推进,不设硬性时间表,实际进展以 GitHub 为准。目前的方向:
- 打磨现有功能,从公开测试走向稳定版
- 更多本地模型与更好的说话人分离
- 字幕编辑器体验持续改进