crossvit_base_cls(pretrained: bool | str = False, weights: CrossViTBaseWeights | None = None, overrides: object = {})CrossViT-B image classifier — embed_dims=(384, 768), depths
((1, 4, 0)) x 3, 12 heads per branch. ~105M params; paper
Table 2 reports 82.2% ImageNet-1k top-1 at 240x240.
Model Size
Parameters
pretrainedbool or str= FalseFalse returns randomly-initialised weights; True loads
the default entry of CrossViTBaseWeights; a string
selects a named entry from that enum.Explicit weight-enum member overriding
pretrained.**overridesobject= {}Per-field overrides forwarded to
CrossViTConfig.Returns
CrossViTForImageClassificationThe configured classifier.
Notes
Reference: Chen, Fan, and Panda, "CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification", ICCV 2021 (arXiv:2103.14899).