常见问题

安装、模型、GPU 与故障排查。找不到答案?去 GitHub Issues 提问。

如何让 AI 功能完全跑在本地?Ollama 图文配置教程(Windows / macOS)

ASRbox 的 AI 校对、字幕翻译和对话功能需要一个 LLM(大语言模型)。用在线服务需要注册账号、按量付费,字幕文本也会发送给第三方;而通过 Ollama 把模型跑在你自己的电脑上,免费、离线、文本不出本机。全程大约 15 分钟,跟着下面的步骤做即可。

第 1 步:下载并安装 Ollama

打开 Ollama 官网下载页,按你的系统选择 macOS 或 Windows 版本下载安装:

ollama.com/download
图 1:Ollama 官网下载页(ollama.com/download),选择对应系统
图 1:Ollama 官网下载页(ollama.com/download),选择对应系统

安装完成后启动 Ollama——macOS 在菜单栏、Windows 在系统托盘会出现小羊驼图标,表示服务已在后台运行。然后在终端(Windows 用 PowerShell)验证安装:

ollama --version

网络提示(国内用户重要)

ollama.com 官网和模型仓库在国内访问不稳定,强烈建议全程在科学上网环境下进行。网页下载走浏览器代理即可;在终端拉取模型时需要单独让命令行走代理(端口换成你自己代理工具的端口):

macOS / Linux 终端:
HTTPS_PROXY=http://127.0.0.1:7897 ollama pull qwen3:4b
Windows PowerShell:
$env:HTTPS_PROXY="http://127.0.0.1:7897"; ollama pull qwen3:4b

第 2 步:按显存 / 内存选择模型

打开 qwen3 的模型页可以看到每个型号的下载体积(见下方图 2)。给 ASRbox 做字幕校对和翻译,4b~8b 已经很够用;字幕很长、或者常用对话功能分析整份字幕,建议 8b 起步。参考下表按硬件选择:

型号下载体积建议配置说明
qwen3:1.7b 1.4 GB 8 GB 内存 能跑即可,质量一般,适合先试试水
qwen3:4b 2.5 GB 16 GB 内存 / 4 GB+ 显存 轻量推荐:256K 长上下文,速度快
qwen3:8b 5.2 GB 16~24 GB 内存 / 8 GB 显存 质量与速度最平衡,多数人的选择
qwen3:14b 9.3 GB 32 GB 内存 / 12 GB 显存 更高质量,速度明显变慢
qwen3:30b 19 GB 48 GB+ 内存 / 16 GB+ 显存 高端机尝鲜,非必需
ollama.com/library/qwen3/tags
图 2:qwen3 各型号的下载体积(ollama.com/library/qwen3/tags)
图 2:qwen3 各型号的下载体积(ollama.com/library/qwen3/tags)

Windows 看显卡显存;macOS 是统一内存,模型大约只能用到内存的一半(其余要留给系统)。模型越大越聪明但也越慢——"改错字、做翻译"这种活并不需要很大的模型。

第 3 步:拉取模型

在终端执行(以 qwen3:4b 为例,追求更准换成 qwen3:8b 即可):

ollama pull qwen3:4b

下载完成后,用这个命令查看本机已安装的模型:

ollama list
图 3:终端中拉取模型并查看已安装列表
图 3:终端中拉取模型并查看已安装列表

下载支持断点续传,中途失败重新执行同一条命令即可,不会从头再来。

第 4 步:在 ASRbox 中一键接入

  1. 1 保持 Ollama 在后台运行(菜单栏 / 托盘有小羊驼图标),打开 ASRbox 的"设置 → AI LLM 提供商",点击"新增 LLM 提供商"。
  2. 2 "厂商预设"选择 Ollama:地址会自动填好 http://localhost:11434/v1,密钥留空——本地服务不需要密钥。
  3. 3 点击"拉取模型":下拉框会直接列出你电脑上已安装的全部模型,点选想要的那个(比如 qwen3:4b)即可,不用手动输入模型 ID。
  4. 4 点击"创建",ASRbox 会自动测试连接;提供商卡片上出现"本地端点"徽章,就说明配置成功了。
ASRbox
图 4:选择 Ollama 预设后点击"拉取模型",直接点选本机已装模型
图 4:选择 Ollama 预设后点击"拉取模型",直接点选本机已装模型
ASRbox
图 5:提供商卡片显示"本地端点"徽章,配置完成
图 5:提供商卡片显示"本地端点"徽章,配置完成

之后在 AI 校对、字幕翻译、对话中选择这个提供商,即可全程离线使用。Docker 版注意:在容器里访问宿主机的 Ollama,要把地址改成 http://host.docker.internal:11434/v1,不能用 localhost。

我的电脑能运行 ASRbox 吗?

桌面版支持 Windows 10 / 11(64 位)和 macOS(Apple Silicon,M1 及之后的芯片)。8 GB 内存可以起步使用小模型;想用 large 级别大模型、或同时跑 AI 校对翻译,建议 16 GB 以上。Windows 有 NVIDIA 显卡的话,还可以在应用内一键安装 CUDA 套件大幅提速。

也提供 Docker Web 版,需要 Linux 环境、8 GB 内存与 15 GB 磁盘,适合部署在自己的服务器上给多人使用。暂时没有 Linux 桌面版与 Intel Mac 版。

macOS 提示"应用已损坏,无法打开"怎么办?

这并不是真的损坏。ASRbox 是免费开源软件,没有购买苹果的开发者签名证书,macOS 对来源陌生的应用就会给出这个默认提示,个人开发者的应用普遍如此。

两种解决方法任选:① 把 ASRbox 拖进"应用程序"文件夹后,打开"终端"执行 xattr -cr /Applications/ASRbox.app,再重新打开;② 先正常打开一次(会报错),然后去"系统设置 → 隐私与安全性",在页面底部的安全性一栏点击"仍要打开"。不放心的话,可以先用下载页提供的 SHA256SUMS.txt 核对安装包完整性。

Windows 安装时 SmartScreen 拦截怎么办?

在蓝色的提示窗口中点击"更多信息",然后选择"仍要运行"即可正常安装。这个提示是因为 ASRbox 暂未购买代码签名证书,新发布、下载量不大的应用都会经历这个阶段,并不代表软件有问题。

谨慎起见,安装前可以用下载页的 SHA256SUMS.txt 核对安装包:在下载目录打开终端执行 certutil -hashfile 文件名 SHA256,与校验文件中的值一致就可以放心安装。

转写速度怎么样?

主要取决于模型大小和硬件:小模型(base / small)快而粗略,大模型(large-v3 系列)慢而准确。日常几分钟的音频,用小模型通常几十秒就能完成;large-v3-turbo 在质量和速度之间比较均衡,是多数人的日常选择。

硬件方面:Windows 安装 NVIDIA CUDA 套件后最高提速约 10 倍("设置 → 加速"里一键安装);macOS 自动使用 Apple GPU,无需任何配置。纯 CPU 也能跑,只是大模型会慢一些。

模型下载很慢或失败?

模型托管在 Hugging Face 与 ModelScope。国内网络访问 Hugging Face 可能较慢,可以在设置中把下载源切换到 ModelScope,或为应用配置代理。

下载支持暂停与断点续传,中断后继续即可,已完成的部分不会重新下载。大模型体积有好几个 GB,进度条看似不动时其实是在写入分片,请耐心等待。

在线 ASR / AI 功能会把我的音频发出去吗?

本地转写全程离线,媒体文件不会离开你的电脑。只有你主动选择"在线 ASR"提供商时,音频才会发送给你自己选的那家服务商。

AI 校对、翻译与对话只发送字幕文本和有限的相邻上下文,绝不发送音频、文件名或本地路径。想让 AI 功能也完全不出本机,可以按上面的教程接入本地 Ollama。更多细节见隐私说明。

如何更新到新版?

应用内"设置 → 关于"可以检查更新,可选稳定版 / 预览版通道。检测到新版后会下载安装包并在应用内校验 SHA256,然后提示你手动安装。

也可以随时在本站下载页或 GitHub Releases 下载最新安装包直接覆盖安装,任务、字幕版本和设置都会保留。

转写结果不准确怎么办?

依次尝试:换更大的模型(如 large-v3-turbo,准确率明显提升但更慢);确认转写语言选对了,方言或中英混杂可以试试"自动";优先使用 Faster Whisper 系列模型,它带词级时间戳,方便对照音频定位错误。

转写完成后还可以用"AI → 字幕核对"让 LLM 再检查一遍,错字、漏字会给出可直接套用的修改建议;本地 Ollama 和在线模型都可以做这一步。

Docker 版能访问 GPU 吗?

当前 Docker 镜像面向 Linux CPU 环境,暂未内置 GPU 支持。需要 GPU 加速请使用 Windows 或 macOS 桌面版。

故障排查

更完整的故障排查清单(日志位置、常见报错)在 GitHub 文档中维护:

打开故障排查文档

路线图

ASRbox 由个人开发者在业余时间推进,不设硬性时间表,实际进展以 GitHub 为准。目前的方向:

  • 打磨现有功能,从公开测试走向稳定版
  • 更多本地模型与更好的说话人分离
  • 字幕编辑器体验持续改进

参与贡献

报 bug、提建议、改文档、交代码都欢迎。最简单的开始方式:到 GitHub Issues 留下你的使用反馈。

去 GitHub Issues