一次失败实验记录:为什么效果不稳定
补档说明:本文属于「AI 工程落地周记」系列,计划发布时间为 2025-01-30 09:10。当前先保留为草稿,后续补充真实案例、代码片段和复盘细节后再发布。
这次失败实验发生在一个看起来很“稳”的场景里。我们当时做的是一段常见的知识问答链路:用户提问,系统从知识库里取回上下文,再让模型给出总结式回答。小样本测试时效果不错,前十几个问题几乎都能答到点上,所以团队一度觉得这个方向很顺。
但把样本放大一点之后,结果开始明显飘了。同样的提问方式,今天答得不错,隔几小时再测一次,回答里的重点就会变化;换一个近义表达,答案会突然把次要信息讲得很重,真正关键的结论反而变淡。
