crossvit_base_cls(pretrained: bool | str = False, weights: CrossViTBaseWeights | None = None, overrides: object = {})CrossViT-B image classifier — embed_dims=(384, 768), depths
((1, 4, 0)) x 3, 12 heads per branch. ~105M params; paper
Table 2 reports 82.2% ImageNet-1k top-1 at 240x240.
Model Size
Parameters
pretrainedbool or str= FalseFalse returns randomly-initialised weights; True loads
the default entry of CrossViTBaseWeights; a string
selects a named entry from that enum.Explicit weight-enum member overriding
pretrained.**overridesobject= {}Per-field overrides forwarded to
CrossViTConfig.Returns
CrossViTForImageClassificationThe configured classifier.
Notes
Reference: Chen, Fan, and Panda, "CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification", ICCV 2021 (arXiv:2103.14899).
Examples
>>> import lucid
>>> from lucid.models.vision.crossvit import crossvit_base_cls
>>> model = crossvit_base_cls()
>>> out = model(lucid.randn(1, 3, 240, 240))
>>> out.logits.shape
(1, 1000)