Ornith 1.5 会让 Agent 越用越聪明吗:自生成训练任务不等于在线自我进化
最近看 Ornith 1.5 时,一个说法很容易让人兴奋:它能自己生成训练任务,所以 Agent 是不是会在日常使用中“越用越聪明”?
我的答案是:**可以形成越用越贴近真实工作的改进闭环,但它不是聊天时自动学习,更不是不需要数据。**真正发生的事情是,系统把已授权的使用信号转成可验证任务,在隔离环境里训练候选版本,再由独立评测决定是否发布。
最近看 Ornith 1.5 时,一个说法很容易让人兴奋:它能自己生成训练任务,所以 Agent 是不是会在日常使用中“越用越聪明”?
我的答案是:**可以形成越用越贴近真实工作的改进闭环,但它不是聊天时自动学习,更不是不需要数据。**真正发生的事情是,系统把已授权的使用信号转成可验证任务,在隔离环境里训练候选版本,再由独立评测决定是否发布。
AI 编程 Agent 的能力在过去一年里突飞猛进。Codex 能重构整个模块,Claude Code 能自主修复 bug,Cursor 能理解整个代码库。但如果你真的让它们跑一个跨越数天的长任务,大概率会收获这样的结果:目标悄悄漂移、同一个错误重试几十次、中断后从头开始、烧了一堆 Token 却看不到有效进展。
LoopX 就是为了解决这个问题而生的。它不教 Agent 变得更聪明,而是给 Agent 装了一套"制度"——让长期任务可控、可追踪、可恢复。
大模型会聊天,但不会干活。真正让 AI Agent 能接住复杂任务的,不是模型有多聪明,而是外面裹着的那层"缰绳"——Harness。当任务要跨多个 API、文件格式和多轮状态时,真正决定成功率的是模型外层的工程控制。
过去一年,很多团队都在研究怎么把大模型变成 Agent:给它工具,给它权限,给它任务,让它能自己跑起来。
于是大家开始关注 Prompt、Context、Tool Use、Workflow、Harness。可是当 Agent 真的开始进入开发、运维、研究、文档和业务流程以后,一个更底层的问题浮出来了:Agent 到底工作在一个什么环境里?
这就是 Environment Engineering 想解决的问题。
如果说 Harness 解决的是“怎么管住 Agent”,那么 Environment 解决的是“Agent 面对的世界是否可靠”。前者更像运行时控制系统,后者更像训练场、考场和工作制度。
飞书官方在 2026 年 4 月开源了飞书 CLI(lark-cli),一个月内 GitHub Stars 飙到 9.8k。这个工具最大的亮点是:让 AI Agent 能以用户的个人身份操作飞书。我花了一个下午把它接入了 Hermes Agent,这篇文章记录整个过程和踩过的坑。
一个人 + 一个 AI Agent,一天能干多少活?今天我做了一个实验。
最近同时在用 OpenClaw 和 Hermes Agent 做日常开发和自动化任务,用了一段时间后,觉得有必要把两者的使用感受整理一下。这篇不是广告,纯粹从一个实际使用者的角度出发,聊聊两者在功能、Token 消耗、易用性和各自优势方面的差异。
Hermes Agent 的迭代速度很快——v0.11.0 一个版本就合并了 761 个 PR、1556 次提交。版本更新是日常操作,但如果流程不规范,轻则消息丢几条,重则配置全丢、服务起不来。
这篇文章把我在实际更新过程中总结的流程整理出来,适用于当前 v0.11.0(v2026.4.23)及后续版本,重点是怎么更新不出事,出了事怎么恢复。