跳到主要内容
一介布衣
全栈开发者
查看所有作者

大模型上下文如何科学管理:不要把聊天记录当数据库

· 阅读需 7 分钟
一介布衣
全栈开发者

很多人刚开始做大模型应用时,会把上下文理解成“聊天记录”。用户说过的话越多,全部拼接给模型,似乎模型就越了解用户。

但实际情况往往相反。历史消息越长,越容易混入过期信息、无关闲聊和互相冲突的指令。模型还可能因为上下文太长而超出限制,或者忽略真正重要的内容。

科学的上下文管理不是尽可能多地塞内容,而是:

每次只给模型完成当前任务所必需、可靠、最新的信息。

大模型输出为什么要做三层校验:从 JSON 到业务事实

· 阅读需 7 分钟
一介布衣
全栈开发者

大模型很擅长理解人话,也很擅长把结果组织成看起来完整的句子。但在真正的业务系统里,“看起来合理”远远不够。

比如用户让 AI 查询订单,大模型可能返回这样一段内容:

{
"order_id": "12345",
"include_items": true
}

这段内容看上去没有问题,可它只说明模型提出了两个参数。它没有证明订单 12345 真的存在,也没有证明当前用户有权查看这个订单。

因此,大模型应用通常需要连续做三层校验:先确认内容能不能读,再确认格式是否符合约定,最后确认它是否符合真实业务规则。

Ornith 1.5 会让 Agent 越用越聪明吗:自生成训练任务不等于在线自我进化

· 阅读需 8 分钟
一介布衣
全栈开发者

最近看 Ornith 1.5 时,一个说法很容易让人兴奋:它能自己生成训练任务,所以 Agent 是不是会在日常使用中“越用越聪明”?

我的答案是:**可以形成越用越贴近真实工作的改进闭环,但它不是聊天时自动学习,更不是不需要数据。**真正发生的事情是,系统把已授权的使用信号转成可验证任务,在隔离环境里训练候选版本,再由独立评测决定是否发布。

LoopX 深度解析:给长程 AI Agent 装上控制面

· 阅读需 9 分钟
一介布衣
全栈开发者

AI 编程 Agent 的能力在过去一年里突飞猛进。Codex 能重构整个模块,Claude Code 能自主修复 bug,Cursor 能理解整个代码库。但如果你真的让它们跑一个跨越数天的长任务,大概率会收获这样的结果:目标悄悄漂移、同一个错误重试几十次、中断后从头开始、烧了一堆 Token 却看不到有效进展。

LoopX 就是为了解决这个问题而生的。它不教 Agent 变得更聪明,而是给 Agent 装了一套"制度"——让长期任务可控、可追踪、可恢复。

从 PRD 到 XMind:开发和测试如何用 AI Skill 快速生成可导入的测试用例

· 阅读需 9 分钟
一介布衣
全栈开发者

拿到一份 PRD,测试工程师通常要做三件事:找出功能模块,补齐测试场景,再把结果整理成团队能评审的用例结构。开发工程师也需要同一份结构,只是关注点会更靠近接口、状态、数据约束和异常处理。

这中间最容易丢掉的不是“正常流程”,而是那些藏在句子里的限制:字段长度的上下限、重复提交时的行为、不同角色看到的数据、订单状态不能倒退的规则。prd-to-xmind-testcases 这个 Codex Skill 做的事情很具体:读取 PRD,把需求拆成 XMind 可以导入的 Markdown 测试用例大纲。

DESIGN.md:让 AI Agent 真正读懂你的 UI 风格

· 阅读需 8 分钟
一介布衣
全栈开发者

AI 写前端,最常见的问题往往不是功能跑不起来,而是页面“看起来不像你想要的东西”:颜色不对、字体随意、间距没有节奏、组件圆角到处变化。你在一次对话里解释过设计规范,下一次对话却还要从头解释;截图、Figma 链接和口头描述也很难成为稳定的项目上下文。

Google Labs 的 DESIGN.md 试图解决的就是这个问题:用一个放在代码仓库里的纯文本文件,把设计系统和设计意图交给 AI coding agent 反复读取。

Chinese-CLIP 使用、训练与量化全梳理

· 阅读需 13 分钟
一介布衣
全栈开发者

中文多模态里,Chinese-CLIP 一直是一个很实用但也很容易被“半懂不懂地使用”的模型。很多人知道它能做图文检索、零样本分类,也知道它有 ViT-B/16ViT-L/14ViT-H/14 这些规模,但一旦往工程里落,问题马上就会变具体:

  • 我到底应该用 cn_clip 官方 API,还是直接走 Hugging Face 的 ChineseCLIPModel
  • 训练是不是只能全量训?有没有更省资源的办法?
  • 它官方支持到什么程度?哪些压缩/量化路线是 Chinese-CLIP 原生支持,哪些只是通用工具链“理论可套”?

我把公开资料重新过了一遍,尽量只看原作者和主流官方工具链的第一手文档。下面这篇,等价于一个截至 2026 年 7 月 21 日 的“Chinese-CLIP 可落地方法地图”。

Qwen3-TTS 完整指南:开源模型、本地部署与 API 对比

· 阅读需 9 分钟
一介布衣
全栈开发者

2026 年,开源 TTS 领域迎来一个重要节点:阿里通义千问团队正式开源了 Qwen3-TTS 系列模型。这是目前开源社区中功能最全面的 TTS 方案之一,支持语音克隆、语音设计、指令控制情绪语速,并且模型完全开放下载。

我花了一些时间把 Qwen3-TTS 的公开资料、官方文档、定价信息和竞品对比整理了一遍,尽量把"能跑起来"和"能落地到产品里"这两件事分清楚。