CrossViT-18 backbone — embed_dims=(224, 448), depths
((1, 6, 0))×3, 7 heads. ~43.3M params (paper Table 2).
Model Size
Examples
>>> import lucid
>>> from lucid.models.vision.crossvit import crossvit_18
>>> model = crossvit_18()
>>> out = model(lucid.randn(1, 3, 240, 240))
>>> out.last_hidden_state.shape
(1, 672)