这里是 another-Layn 的博客

做一些记录。

最新记录

持续整理,逐步积累

ResNet、ViT 与 CLIP:从视觉骨干到图文对齐

从残差学习和图像分块出发,理解 CLIP 如何用图文配对训练共享表征空间,并通过文本描述构造分类器。本文以 CLIP 为重点,联系三篇论文的不同贡献。

  ·  10 分钟阅读  ·  论文阅读