crossvit_18_cls(pretrained: bool | str = False, weights: CrossViT18Weights | None = None, overrides: object = {})CrossViT-18 image classifier — embed_dims=(224, 448), depths
((1, 6, 0)) x 3, 7 heads per branch. ~43.3M params; paper
Table 2 reports 82.5% ImageNet-1k top-1 at 240x240.
Model Size
Parameters
pretrainedbool or str= FalseFalse returns randomly-initialised weights; True loads
the default entry of CrossViT18Weights; a string
selects a named entry from that enum.Explicit weight-enum member overriding
pretrained.**overridesobject= {}Per-field overrides forwarded to
CrossViTConfig.Returns
CrossViTForImageClassificationThe configured classifier.
Notes
Reference: Chen, Fan, and Panda, "CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification", ICCV 2021 (arXiv:2103.14899).