跳到主要内容

37 篇博文 含有标签「工程化」

查看所有标签

Function calling 的工具 schema 要像 API 一样设计

· 阅读需 2 分钟
一介布衣
全栈开发者

工具 schema 设计 这件事在 2023 年开始越来越频繁地进入真实项目,但很多团队一开始只看到表面收益,没有先把边界收住。只要 字段定义模糊、可选项太多,模型会频繁给出半对半错的调用参数,问题就会很快从“一个小体验瑕疵”变成系统性的维护成本。

RAG 观测指标先看命中率和上下文链路

· 阅读需 3 分钟
一介布衣
全栈开发者

RAG 观测体系 这件事在 2023 年开始越来越频繁地进入真实项目,但很多团队一开始只看到表面收益,没有先把边界收住。只要 系统效果波动时,只能靠人工体感猜是哪一环出了问题,问题就会很快从“一个小体验瑕疵”变成系统性的维护成本。

切换 embedding 模型前先算切换成本

· 阅读需 3 分钟
一介布衣
全栈开发者

embedding 模型切换成本 这件事在 2023 年开始越来越频繁地进入真实项目,但很多团队一开始只看到表面收益,没有先把边界收住。只要 只盯着单点评测结果,忽略了索引重建和线上切换的系统代价,问题就会很快从“一个小体验瑕疵”变成系统性的维护成本。

检索前做 query rewrite 什么时候值得

· 阅读需 2 分钟
一介布衣
全栈开发者

query rewrite 这件事在 2023 年开始越来越频繁地进入真实项目,但很多团队一开始只看到表面收益,没有先把边界收住。只要 原始问题太口语或太短,检索阶段根本抓不到真正意图,问题就会很快从“一个小体验瑕疵”变成系统性的维护成本。

离线评测要先于在线 A/B

· 阅读需 3 分钟
一介布衣
全栈开发者

离线评测优先级 这件事在 2023 年开始越来越频繁地进入真实项目,但很多团队一开始只看到表面收益,没有先把边界收住。只要 线上实验承担了本该在离线阶段就拦住的问题,影响真实用户体验,问题就会很快从“一个小体验瑕疵”变成系统性的维护成本。

LLM 评测数据集的标注规则先写清楚

· 阅读需 2 分钟
一介布衣
全栈开发者

评测标注规则 这件事在 2023 年开始越来越频繁地进入真实项目,但很多团队一开始只看到表面收益,没有先把边界收住。只要 不同人按不同理解给样本打分,最后得出的结论只会越来越混乱,问题就会很快从“一个小体验瑕疵”变成系统性的维护成本。

Electron Updater 的签名和产物细节

· 阅读需 3 分钟
一介布衣
全栈开发者

签名与产物细节 这件事在 2023 年开始越来越频繁地进入真实项目,但很多团队一开始只看到表面收益,没有先把边界收住。只要 构建出来的应用没问题,但更新元数据和签名链路一断,用户就永远升不上去,问题就会很快从“一个小体验瑕疵”变成系统性的维护成本。

Bun 进入 CI 前先想清楚采用边界

· 阅读需 3 分钟
一介布衣
全栈开发者

CI 采用边界 这件事在 2023 年开始越来越频繁地进入真实项目,但很多团队一开始只看到表面收益,没有先把边界收住。只要 本地替代很顺利,但 CI 管线一旦失败,团队没有现成经验兜底,问题就会很快从“一个小体验瑕疵”变成系统性的维护成本。