Hermes Agent v0.14.0(代号“The Pinnacle Release”)已于 2026年5月16日 正式发布。这个版本被定位为 Hermes Agent 发展的一个巅峰时刻,核心在于将 Hermes 从一个“工具调用者”彻底转变为一个通用的 AI 操作系统内核。
v0.14.0 的核心亮点在于引入了多模态感知与行动能力(Vision + Action),让 Agent 能够“看懂”屏幕并像人类一样操作键盘鼠标,同时在架构上实现了完全的模块化。
核心能力升级:视觉与行动 (Vision & Action)
1. 原生视觉感知 (Vision)
- 视觉模式:Hermes 现在支持原生视觉模式,能够处理图像输入。
- 多模态模型支持:集成了 GPT-4o 和 Claude 3.5 Sonnet 的视觉能力,支持通过
hermes model命令切换。 - 图像路由:在 MCP(模型上下文协议)中实现了基于模型视觉能力的图像路由,确保视觉任务分配给合适的模型。
2. 屏幕操作与自动化 (Action)
- GUI 自动化:引入了
gui_control和keyboard_mouse工具,允许 Hermes 直接控制屏幕上的 GUI 元素(点击、输入、滚动)。 - Vision-Action 循环:实现了“看(Vision) -> 思考(Reasoning) -> 动(Action)”的闭环,让 Agent 能够像人类用户一样操作电脑软件。
- 屏幕阅读器:集成了
screen_reader工具,能够 OCR(光学字符识别)屏幕内容并将其转化为文本供模型理解。
架构革新:模块化与插件化
1. 完全插件化架构
- 核心剥离:v0.14.0 将核心逻辑剥离,实现了 100% 的插件化。核心仓库现在仅包含运行时框架,所有功能(模型、工具、平台)都通过插件加载。
- 插件生态系统:引入了插件清单(Manifest)系统,支持从远程仓库动态拉取和更新插件,无需更新核心 Agent 即可扩展功能。
2. 新的模型上下文协议 (MCP) v2
- 双向流:支持双向流式传输,允许工具和模型之间进行实时的增量通信。
- 状态同步:改进了工具状态的同步机制,确保在长时间运行的任务中状态的一致性。
智能增强:推理与记忆
1. 深度推理模式 (Deep Reasoning)
- R1 模型集成:集成了 DeepSeek-R1 等深度推理模型,支持在 TUI 和 Dashboard 中一键切换。
- 思维链优化:优化了思维链(Chain-of-Thought)的生成逻辑,减少了幻觉,提高了复杂问题的解决能力。
2. 记忆系统升级
- 向量数据库:引入了本地向量数据库(基于 ChromaDB),支持长期内存的存储和检索。
- 记忆压缩:实现了记忆压缩算法,自动归纳和总结历史对话,防止上下文窗口溢出。
开发者工具与平台支持
- Web 仪表盘重构:Dashboard 进行了全面重构,支持实时查看 Agent 的思维过程、工具调用栈和内存状态。
- TUI 增强:TUI 现在支持分屏模式,可以同时查看日志、内存和当前任务状态。
- 新平台支持:新增了对 Slack 和 Telegram 的原生插件支持,使其成为第 21 和第 22 个支持的平台。
Hermes Agent v0.14.0 核心更新速览
| 类别 | 关键更新 | 说明 |
|---|---|---|
| 核心能力 | Vision + Action | 支持图像输入、屏幕阅读、GUI 控制,实现真正的视觉交互。 |
| 架构 | 100% 插件化 | 核心剥离,所有功能通过插件加载,支持动态扩展。 |
| 模型 | GPT-4o / Claude 3.5 | 原生支持最新的多模态模型,提供更强的视觉理解能力。 |
| 自动化 | GUI Control | 可以像人类一样操作键盘鼠标,控制电脑上的任何应用程序。 |
| 记忆 | 向量数据库 | 引入本地向量库,支持长期记忆存储和检索。 |
Hermes Agent v0.14.0 是一个里程碑式的版本。它不再仅仅是一个聊天机器人或简单的工具调用者,而是进化成了一个具备视觉感知和物理操作能力的通用 AI 操作系统。通过 Vision-Action 循环和完全插件化的架构,它为构建真正自主的 AI 助手奠定了基础。