CrossViT-15 backbone — embed_dims=(192, 384), depths
((1, 5, 0))×3, 6 heads. ~27.4M params (paper Table 2).
Model Size
Examples
>>> import lucid
>>> from lucid.models.vision.crossvit import crossvit_15
>>> model = crossvit_15()
>>> out = model(lucid.randn(1, 3, 240, 240))
>>> out.last_hidden_state.shape
(1, 576)