前置条件与准备工作
动手前,建议先确认以下几项,避免执行到一半发现缺东西:
- 基础环境:你已经在本地安装了 Hermes Agent,并完成过至少一次基本对话。如果还没用过,先跑一遍官方快速开始。
- 系统要求:Ollama 支持 Windows / macOS / Linux,Open WebUI 推荐用 Docker 安装(Docker 需预先装好)。方案三的 YAML 修改需要任意文本编辑器。
- 账号准备:Ollama 方案需要注册一个 Ollama 账号(免费);方案三需要 MiniMax 国内 API Key、Google AI Studio 的 API Key。这两个都可以免费申请,但有额度限制。
- 网络要求:使用云端模型时需要稳定的互联网连接。如果在大陆访问某些 API 端点,可能需要自行解决网络问题。
- 备份意识:无论哪种方案,修改配置文件前一定先备份。后面会给出具体备份命令。
这套方案适合谁?不适合谁?
- 适合:已经会用终端操作 Hermes Agent,但觉得本地跑模型太吃硬件、终端界面太简陋、Token 消耗太快的用户。想零成本体验云端模型的新手也可以从方案一开始。
- 不适合:完全没接触过命令行的纯小白(至少在装完 Ollama 后也需要执行一条命令);手头只有 4GB 内存的旧电脑(运行 Open WebUI 本身需要一定内存,建议至少 2GB 空闲);对数据隐私要求极高、不允许任何数据出本地的人(Ollama 云端模型和 Open WebUI 都涉及网络通信)。
- 什么时候用:当你在终端里跟 Hermes Agent 对话超过 10 次,开始觉得每次查历史好痛苦、本地风扇呼呼转的时候,就是时候了。
- 什么时候不要用:如果你只在本地跑完全不联网的模型(比如用 llama.cpp 纯 CPU 推理),且对界面没要求,那方案一和方案三都不适用,方案二倒可以单独用作前端。
为什么需要进阶配置?从痛点说起

默认运行 Hermes Agent 的方式——直接在终端里通过命令行交互,对于尝鲜来说没问题,但用久了就会发现几个挺头疼的地方。本地跑一个像模像样的模型,硬件要求并不低。如果你只有一块普通显卡或者纯靠 CPU 推理,响应速度会很慢,而且电脑风扇呼呼转,严重影响干其他活。终端界面实在太简陋了,没有对话历史管理,Markdown 格式的回复看着像乱码,代码块经常被聊天工具截断。很多人试过把 Hermes Agent 挂到微信或 Telegram 上,结果发现消息一多就翻不到头,想找之前的某段对话得翻半天。最后,如果你想让 Hermes Agent 干点复杂的活——比如写代码、查资料、调用工具——消耗的 Token 数量涨得飞快,用付费 API 的话钱包很快见底。
这三个痛点分别对应了资源占用、交互体验和 Token 成本。这篇文章就是针对这些问题,提供三个可落地的方案:用 Ollama 一键调用免费云端模型,彻底释放本地资源;用 Open WebUI 打造一个类 ChatGPT 的漂亮界面,支持手机端访问;通过主副模型分工配置,把核心对话交给高质量模型,辅助任务(比如压缩记忆、生成标题、技能搜索)交给免费模型,把 Token 消耗降下来。这三个方案可以单独用,也可以组合起来用。下面一步步来。
方案一:Ollama 一键集成免费云端模型

这个方案适合想零成本快速上手的新手,或者手头没有强劲 GPU、又不想花钱买 API 额度的情况。Ollama 本身已经内置了 Hermes Agent 的集成入口,不需要你单独去 GitHub 拉代码、配环境。
操作步骤
Step 1:下载并安装 Ollama
去 Ollama 官网找到对应你操作系统的安装包(Windows、macOS、Linux 都有)。下载完直接安装,打开之后会在系统托盘里看到一个羊驼图标,说明 Ollama 已经跑起来了。
Step 2:查看集成项
打开 Ollama 的主窗口(或者右键点托盘图标),你会看到一个列表,里面已经集成了 OpenClaw、Claude Code、Codex 和 Hermes Agent 等工具。这就是所谓的“一键集成”,不用自己手动配置 provider。
Step 3:复制启动命令并执行
点击 Hermes Agent 条目,Ollama 会给出一个启动命令(类似 ollama run hermes3 之类的)。复制它,在终端里回车执行。这时 Hermes Agent 的 Gateway 会开始启动,并弹出一个模型选项界面。
Step 4:选择云端模型
在模型列表中,前面几个模型名称后面带“Cloud”后缀的,表示它们走的是 Ollama 的云端通道,不占用你本地任何资源。演示中选的是 MiniMax M2.7,你也可以选其他 Cloud 模型。注意:这些云端模型有免费额度,但具体限制建议以 Ollama 官方说明为准,超出后可能会限速或收费。
Step 5:登录账号
选好模型后,浏览器会自动弹出一个登录页面。随便用一个账号登录(Ollama 账号或第三方账号都行),授权后点击“连接”。页面会提示“设备连接成功”。
Step 6:完成 Gateway 刷新与 App 连接
回到终端,按提示继续。Hermes Agent Gateway 会刷新连接状态。如果你想让 Hermes Agent 连接到某个聊天 App(比如微信、Slack),这里可以选择;如果只是想在终端里用,直接跳过。
Step 7:验证模型
在 Hermes Agent 的聊天界面里输入“你是什么模型”,如果返回“MiniMax M2.7 云端版本”,说明一切正常,而且模型确实跑在云端。
验证方法
除了手动问模型,还可以用命令:“`bash hermes doctor
检查 Gateway 连接状态是否正常。如果 doctor 输出显示所有服务 green,基本就没问题。
### Ollama 方案总结
| 特性 | 说明 |
|------|------|
| 部署方式 | 一条命令完成全部配置,不用安装 Python 或其它依赖 |
| 费用 | 云端模型有免费额度,超出后可能需要付费(需核实 Ollama 最新政策) |
| 资源占用 | 零本地资源消耗,模型推理全在云端 |
| 上手难度 | 低,跟着步骤点几下就好 |
### 风险提醒
- 免费额度会变,建议定期查看 Ollama 官方公告。
- 云端模型延迟取决于你的网络,某些地区可能连接不稳定。
## 方案二:Open WebUI 打造最佳交互体验

直接通过微信或 Telegram 跟 Hermes Agent 聊天,有几个明显硬伤:首先,本地电脑开着的时候必须用另一个设备来访问,多一个步骤就多一分麻烦;其次,大多数聊天软件不支持 Markdown 渲染,代码块、表格、高亮全部挤成一团;最后,单窗口下来回几十条对话,历史记录根本没法管理,想回顾之前某次生成的代码得一直往上翻。
Open WebUI 是一个开源的网页聊天界面,体验跟 ChatGPT 很像:左侧边栏存着所有历史对话,支持 Markdown、代码块独立显示、流式输出,还能在线运行 Python 代码、搜索历史对话、上传文件、引用网页和知识库。你甚至可以在对话结束后自动生成相关问题推荐。
### 部署步骤
**Step 1:安装 Open WebUI**
根据 Open WebUI 官方仓库的文档复制安装命令,在终端执行就行。通常推荐用 Docker 方式:`docker run -d -p 8080:8080 --name open-webui ghcr.io/open-webui/open-webui:main`(具体命令以官方最新为准)。
**Step 2:修改 Hermes Agent 配置文件**
用你喜欢的文本编辑器打开 `~/.hermes/config.yaml`,添加两个参数:
- 启用 API 服务参数(具体字段名需参考源文配置,一般是在 api 部分设置)
- API 密码参数(自定义一个密码,后面 Open WebUI 连接要用)
懒人方法:你可以直接让 Codex 或 Claude Code 这类支持操作文件的 Agent 帮你改,用自然语言描述需求就行。关于这些代码工具的云端部署,之前写过 [OpenAI Codex 使用教程 2026](https://www.kepu51.com/instant-messaging/1006.html),思路类似。
**Step 3:重启 Hermes Gateway**
终端执行重启命令(比如 `hermes gateway restart`),让配置生效。
**Step 4:启动 Open WebUI**
执行 Open WebUI 的启动命令(如果是 Docker,容器已经启动了)。然后在浏览器访问 `http://localhost:8080`。
**Step 5:首次配置连接**
- 点击左下角用户名 → 设置 → 管理员设置 → 连接
- 点击“+”添加连接
- URL 填写:`http://localhost:8642/v1`(这是 Hermes Agent 本地的 API 端口,后缀 `/v1` 表示兼容 OpenAI API)
- 认证凭据填写刚才在配置文件中设置的 API 密码
- 保存
**Step 6:开始使用**
新建一个对话,在模型选择下拉里选中 Hermes Agent,然后就可以直接在网页对话框里聊天了。验证一下:问“你可以调用哪些 Skill”,如果返回 118 个 Skill,说明集成成功。
### 手机端访问(局域网方案)
在手机浏览器里输入 `http://<电脑IP地址>:8080`,登录你的 Open WebUI 账号(首次需要注册一个本地账号)。界面会自动适配手机屏幕,支持流式输出、文件上传、历史记录等全部功能。注意:电脑防火墙需要允许 8080 端口。
### 公网访问(进阶)
如果想在外面通过手机访问家里的 Hermes Agent,可以用 ngrok 或 frp 做内网穿透。ngrok 免费版每次启动会随机分配一个二级域名,适合临时用;长期使用建议自建 frp 服务端。如果你对 VPS 上跑服务有兴趣,可以参考 [Claude Code 云服务器部署与安全使用指南](https://www.kepu51.com/ai-tutorial/861.html),里面涉及远程访问的配置思路。
### 验证方法
1. 浏览器打开 `http://localhost:8080` 能看到登录界面。
2. 在 Open WebUI 中发送任意消息,能收到回复即表示连接正常。
3. 如果连接失败,检查 Hermes Agent 的 8642 端口是否监听:`lsof -i :8642`(macOS/Linux)。
### 风险提醒
- 将 Open WebUI 暴露到公网时,务必设置强密码,并开启 HTTPS(可用反向代理+Let's Encrypt)。
- 手机端访问依赖局域网,如果家庭网络环境复杂(如运营商 NAT),可能需要内网穿透工具。
## 方案三:主副模型分工,大幅节省 Token
Hermes Agent 内部有很多辅助任务:会话压缩、记忆刷新、工具调用审批、技能搜索、标题生成、视觉分析……这些任务如果也走高质量收费模型(比如 Claude、GPT-4),Token 消耗量非常大。通过配置把“主模型”设为高质量模型(用于核心代理由),把“副模型”统一设为 Gemini 2.5 Flash(免费额度大,速度快),辅助任务全部交给副模型,可以省下大量 Token 费用。
### 前置条件
- 已经通过方案一或自己的 API Key 让 Hermes Agent 能正常对话。
- 准备好以下三个环境变量(至少前两个):
- `MINIMAX_CN_API_KEY`:MiniMax 国内 API Key
- `GOOGLE_API_KEY`:Google AI Studio 的 API Key(用于 Gemini)
- `OPENAI_API_KEY`:可选,用于后备
### 完整配置步骤
**Step 0:备份当前配置**```bash
cp ~/.hermes/config.yaml ~/.hermes/config.yaml.bak-$(date +%Y%m%d-%H%M%S)
Step 1:配置环境变量
编辑 ~/.hermes/.env,确保以下 key 都存在(没有的去对应平台申请,年费或免费额度请自行确认):“` MINIMAXCNAPIKEY=yourminimaxkey GOOGLEAPIKEY=yourgoogle_key
**Step 2:主模型配置**
在 `~/.hermes/config.yaml` 中,修改 `model:` 块:```yaml
model:
api_key: env:MINIMAX_CN_API_KEY
base_url: https://api.minimaxi.com/anthropic
default: MiniMax-M2.7
provider: minimax-cn
关键点:
base_url不要带/v1,SDK 会自动追加- 模型 ID 大小写敏感,必须写成
MiniMax-M2.7 provider必须是minimax-cn,这是 MiniMax 国内端点
Step 3:副模型(auxiliary)配置
把 auxiliary: 块下面所有子任务的 provider 和 model 都设为 Gemini 2.5 Flash,参考结构如下(实际字段以配置文件为准,这里是示例):“`yaml auxiliary: approval: provider: gemini model: gemini-2.5-flash timeout: 30 compression: provider: gemini model: gemini-2.5-flash timeout: 120 flushmemories: provider: gemini model: gemini-2.5-flash timeout: 30 mcp: provider: gemini model: gemini-2.5-flash timeout: 30 sessionsearch: provider: gemini model: gemini-2.5-flash timeout: 30 skillshub: provider: gemini model: gemini-2.5-flash timeout: 30 titlegeneration: provider: gemini model: gemini-2.5-flash timeout: 30 vision: provider: gemini model: gemini-2.5-flash timeout: 30 web_extract: provider: gemini model: gemini-2.5-flash timeout: 360
**Step 4:compression 调优**
在配置中找到 `compression:` 部分,设置如下参数,控制会话压缩行为:```yaml
compression:
enabled: true
protect_last_n: 20
target_ratio: 0.2
threshold: 0.5
注意:不要在这里单独放 summarymodel / summaryprovider 等字段,模型选择统一在 auxiliary.compression 中配置。
Step 5:custom_providers(可选)
如果你还想叠加其他自定义 provider(比如自己部署的模型),可以这样加:“`yaml custom_providers:
apimode: chatcompletions base_url: https://generativelanguage.googleapis.com/v1beta name: google-ai
apimode: anthropicmessages base_url: https://api.minimaxi.com/anthropic name: minimax-custom
- api_key: " "
- api_key: " "
注意:`name` 不能与内置 provider 同名;`api_mode` 必须与 `base_url` 端点格式一致(`/anthropic` → `anthropic_messages`,`/v1` → `chat_completions`)。
**Step 6:MCP Servers API Key 安全**
所有 `mcp_servers.*.env` 下的 key 都通过 `env:` 前缀引用,不要写明文:```yaml
mcp_servers:
gbrain:
command: gbrain
args: [ serve ]
env:
OPENAI_API_KEY: env:OPENAI_API_KEY
connect_timeout: 15
timeout: 30
验证方法(以下三条必须依次执行)
① YAML 语法检查“`bash python3 -c "import yaml; yaml.safe_load(open('$HOME/.hermes/config.yaml'😉)" && echo OK
如果输出 `OK` 说明 YAML 格式正确;如果报错,会提示行号,根据提示修正。常见的错误:缩进不一致、冒号后缺空格、字符串未加引号。
**② 配置诊断**```bash
hermes doctor
这个命令会检查所有配置项是否合法、API Key 是否有效、依赖是否安装。如果出现红色或黄色警告,根据具体信息调整。例如“model provider not found”可能意味着 provider 拼写错误。
③ 功能测试“`bash hermes chat -q "Say exactly 'pong' and nothing else." -Q
期望输出格式:`session_id: ... pong`。如果返回 `pong`,说明 API 密钥、模型连接、Gateway 全部正常。如果超时或报错,检查网络和 API Key 额度。
### 回滚方案
如果配置出了问题,随时用之前备份的文件恢复:```bash
cp ~/.hermes/config.yaml.bak-<时间戳> ~/.hermes/config.yaml
风险提醒
- Gemini 2.5 Flash 免费额度有速率限制(每分钟请求数),如果辅助任务太频繁可能触发限制,导致压缩或搜索失败。你可以适当增大
timeout值或减少任务调用。 - MiniMax M2.7 的 API Key 有免费额度,超出后按量计费,具体标准需查看 MiniMax 官网。本文无法保证永久免费。
- 所有环境变量不要写在 YAML 明文里,用
env:引用。
如何组合使用三种方案?
这三种方案不是互斥的,完全可以叠加起来用,效果最好。
| 组合方式 | 适合人群 | 核心优势 | 难度 |
|---|---|---|---|
| 只用方案一 | 新手、零成本尝鲜 | 3分钟上手,免费云端模型 | ⭐ |
| 方案一 + 方案二 | 日常重度使用 | Ollama 免费模型 + 类 ChatGPT 界面,手机都能用 | ⭐⭐ |
| 方案一 + 方案二 + 方案三 | 高阶玩家、长期使用 | 免费模型的省钱 + 漂亮界面的舒适 + 主副模型的极低 Token 消耗 | ⭐⭐⭐ |
举个例子:用 Ollama 快速拉一个 MiniMax M2.7 云端模型作为主力模型,同时通过 Open WebUI 获得漂亮的网页界面,然后在配置里把辅助任务全部甩给 Gemini 2.5 Flash。这样你每次对话,核心推理走的是免费额度(或低价的 MiniMax),压缩记忆、技能搜索这些后台任务走 Gemini 的免费配额——Token 消耗至少能降一半以上。
如果你是程序员,还可以把 Hermes Agent 和你的 VPS 结合使用,比如在远程服务器上跑 Hermes Agent,然后用 Open WebUI 从任何地方访问。关于 VPS 上部署 AI 工具,之前我们聊过 Claude Code 云服务器部署与安全使用指南,思路是相通的。另外,如果你想了解 OpenAI Codex 的云端使用方式,也可以参考。
编辑判断:如果你只是偶尔用 Hermes Agent 写点小脚本,方案一就够了。如果你每天都会跟它对话超过半小时,强烈建议加上方案二和方案三。配置一次,长期受益。如果你的 Token 预算非常紧张(比如每个月不希望额外付费),那么优先保证 Gemini 2.5 Flash 的免费额度,必要时降低 auxiliary 中的 timeout 或减少 compression 频率。
常见问题与注意事项
Q:Ollama 的云端模型真的完全免费吗?
有免费额度,但具体额度大小、速率限制、超出后的计费方式,建议以 Ollama 官方最新说明为准。本文写于 2026 年,政策可能会变,请自行核实。
Q:Gemini 2.5 Flash 的免费额度用完怎么办?
Google AI Studio 免费套餐有一定调用量限制(具体数值需查看 Google 官方文档),超出后可以绑定信用卡按量付费,单价很低。如果你完全不打算付费,可以设置 timeout 较短,减少辅助任务调用次数。
Q:配置修改后 Hermes Agent 启动失败?
最常见的原因是 YAML 格式错误。先用 python3 -c "import yaml; yaml.safe_load(open('$HOME/.hermes/config.yaml'))" 检查语法。如果报错,对照上面的示例修正。实在不行就用备份回滚。
Q:Open WebUI 连接不上 Hermes Agent?
检查:1)Hermes Agent 是否已启动并监听 8642 端口(用 lsof -i :8642 查看);2)配置文件中的 API 密码是否与 Open WebUI 设置的一致;3)如果在本机访问用 localhost,如果手机端访问用电脑的局域网 IP。
Q:主副模型分工后,有些辅助任务为什么还是走了主模型?
确保 auxiliary 块下的每个子项都明确设置了 provider: gemini 和 model: gemini-2.5-flash,并且没有在全局 model 块中设置后备模型。并且 compression 部分的模型选择必须在 auxiliary.compression 中配置,不能单独写。
总结
这篇文章给了你三条路:Ollama 一键部署免费云端模型解决资源问题,Open WebUI 解决交互体验问题,主副模型分工解决 Token 成本问题。如果你是新手,先从方案一开始,花 10 分钟就能跑起来。如果你已经在用 Hermes Agent 做日常工具,强烈建议加上方案二和方案三,花半小时配置一次,之后每天都能省下不少钱和耐心。
配置过程中如果遇到问题,记得先备份,再改配置。所有提到的价格、免费额度、模型可用性等信息,均以官方最新公告为准,本文无法保证永久有效。欢迎在评论区分享你的配置经验和踩坑记录,帮助更多读者一起优化 Hermes Agent 的使用体验。
原创文章,作者:kp51,如若转载,请注明出处:https://www.kepu51.com/vps-review/1057.html
