ResNet、ViT 与 CLIP:从视觉骨干到图文对齐从残差学习和图像分块出发,理解 CLIP 如何用图文配对训练共享表征空间,并通过文本描述构造分类器。本文以 CLIP 为重点,联系三篇论文的不同贡献。