crossvit_base(pretrained: bool = False, overrides: object = {})CrossViT-B backbone — embed_dims=(384, 768), depths
((1, 4, 0))×3, 12 heads. ~105M params (paper Table 2).
Model Size
Examples
>>> import lucid
>>> from lucid.models.vision.crossvit import crossvit_base
>>> model = crossvit_base()
>>> out = model(lucid.randn(1, 3, 240, 240))
>>> out.last_hidden_state.shape
(1, 1152)