Chinese-CLIP 使用、训练与量化全梳理
· 阅读需 14 分钟
中文多模态里,Chinese-CLIP 一直是一个很实用但也很容易被“半懂不懂地使用”的模型。很多人知道它能做图文检索、零样本分类,也知道它有 ViT-B/16、ViT-L/14、ViT-H/14 这些规模,但一旦往工程里落,问题马上就会变具体:
- 我到底应该用
cn_clip官方 API,还是直接走 Hugging Face 的ChineseCLIPModel? - 训练是不是只能全量训?有没有更省资源的办法?
- 它官方支持到什么程度?哪些压缩/量化路线是 Chinese-CLIP 原生支持,哪些只是通用工具链“理论可套”?
我把公开资料重新过了一遍,尽量只看原作者和主流官方工具链的第一手文档。下面这篇,等价于一个截至 2026 年 7 月 21 日 的“Chinese-CLIP 可落地方法地图”。
