Hermes从毛坯房到精装修
你的Hermes是不是在吃灰了?
用了两天就闲置了,只会问一句答一句,每次都要重新交代上下文,感觉就是个高级点的搜索 默认的Hermes只是一个临时聪明助手——没有记忆、没有工具、没有眼睛 精装后的Hermes有长期记忆、能上网、能看图、能听能说、能自己进化,不再是聊天机器人,而是你的专属数字分身。
跟着我让它7步让你的Hermes从毛坯变精装。
第一步:定身份
别上来就装工具,先给它一个灵魂 写一份SOUL.md,定义角色、风格、工作方法 不想手写?有现成的行业模板库 agency-agents-zh 免费获取。
GitHub地址:https://github.com/jnMetaCode/agency-agents-zh
第二步:换记忆系统
默认记忆太碎片了,换成Hindsight 对话中自动提取实体、事实、时间,搭建知识图谱,你再也不用重复交代 执行 Hermes memory setup 即可完成配置。
第三步:全网搜索
Tavily 是最热搜索神器,DuckDuckGo 兜底零成本搜索。
第四步:装上网络眼睛
不只是搜索,还要会抓取 Firecrawl、Camoufox 抓单页、深爬、破反爬、模拟浏览器——AI才能真正看懂全网
第五步:解锁多模态能力
- Whisper 多语言语音识别
- Edge TTS 语音合成
- openMontage 一键生视频 让自媒体、视频相关行业工作者效率拉满
第六步:成本精细管控让你的token省到手软
- RTK——通过过滤和压缩命令行输出,把AI编程助手的Token消耗减少60%-90%
- RTK地址:https://github.com/rtk-ai/rtk
- codebase-memory-mcp——把代码库变成持久化知识图谱的MCP Server,能减少99%的Token消耗(上下文更精准)
- codebase-memory-mcp地址:https://github.com/DeusData/codebase-memory-mcp
第七步:Hermes总管
别装一堆工具乱成麻,用 awesome-hermes-agent 一键梳理 这是一个社区维护的导航站,发现新能力、找到解决方案、快速上手的最佳起点。 GitHub地址:https://github.com/0xNyk/awesome-hermes-agent
必装的几个SKILL
Defuddle:把网页"瘦身"再喂给 Agent
解决什么问题:Agent 抓网页时,会把导航、页脚、Cookie 横幅、侧边广告、订阅弹窗全部读进上下文。这些不是你要的内容,却会留在对话里,每多一轮都要重发一遍。 具体怎么做:Defuddle 在 Agent 触碰网页之前,先把它剥成纯净的 Reader Mode Markdown–>只留正文。同一个网页、同一个问题,启用 Defuddle 后 token 消耗可能只是原来的几分之一。 适用边界:只要你的 Agent 做研究–读文档、查资料、扒竞品–这个 Skill 就不是"可选",而是"必装"。它会在你读第一个网页的时候就帮你省钱。
Codebase Memory:让 Agent 别再一遍遍重读代码
解决什么问题:当 Agent 要理解一个陌生代码库,它会从入口文件开始读,再读那些被 import 的文件,再读那些文件 import 的文件–每一个读过的文件都永久留在对话里。一个 3000 token 的文件,在第 4 轮被读过,到第 40 轮已经为同一个问题重复支付了 37 次成本。 具体怎么做:Codebase Memory(严格说是一个 MCP Server,不是单个 Skill 文件)把整个仓库一次性索引成一张"知识图谱"。之后 Agent 不再读文件,而是查询这张图–“这个函数被谁调用?““这个接口在哪里定义?“仓库声称能减少 99% 的探索 token,有朋友实测也达到了 95%,覆盖 158 种语言。 适用边界:
- 适合:陌生仓库的快速接入、跨文件重构、依赖关系梳理
- 不适合:极小项目(一两文件直接读就行);实时变更频繁的代码(索引可能滞后)
Humanizer:让 Agent 的写作"不像 AI”
解决什么问题:你把 Agent 写的文案发到 LinkedIn / 公众号,第一句就被人认出来:“又是 AI”。原因藏在那些 AI 味儿十足的痕迹里:M dash(-)、三段式排比、“delve into”、“in conclusion”、“let me know if you need anything else”…… 具体怎么做:Humanizer 把维基百科上"AI 生成文本的特征"那一页完整抓下来,转化成 Skill。它会扫描 Agent 的输出,把这些"指纹"逐条改写。它会随维基百科的更新自动同步。 适用边界:
提醒一句:Humanizer 文件 29.6 KB,是这份清单里最大的一个。一旦加载,整个会话期间它都住在你的上下文里。所以调用方式跟别人不一样–>不要在一开始就调用它,而是在写作完成的最后一刻单独调一次。深度长会话里,最好把"去 AI 味"这一步放到一个全新的会话里执行。
场景举例:你让 Agent 起草一篇产品发布稿,主会话里只负责结构和内容,最后把草稿复制到新会话,跑一遍 Humanizer,再发出去。
Agent Reach:让 Agent 听得见"人在说什么”
解决什么问题:你的 Agent 聪明、能规划、能写代码–但你让它去查"用户到底在讨论什么”,它就瞎了:
- X(前 Twitter)API 是付费墙
- Reddit 从云端 IP 直接返回 403
- GitHub 还能凑合用,但限流严格
- 其他平台一夜之间改规则 具体怎么做:Agent Reach 一次安装,把 X、Reddit、GitHub 等社交平台全部接进来,零 API 费用。更关键的是它的故障转移机制:当某个平台改了规则封掉一条路径,它已经预备了备用路径,Agent 根本感知不到这次中断。