crossvit_15_cls(pretrained: bool | str = False, weights: CrossViT15Weights | None = None, overrides: object = {})CrossViT-15 image classifier — embed_dims=(192, 384), depths
((1, 5, 0)) x 3, 6 heads per branch. ~27.4M params; paper
Table 2 reports 81.5% ImageNet-1k top-1 at 240x240.
Model Size
Parameters
pretrainedbool or str= FalseFalse returns randomly-initialised weights; True loads
the default entry of CrossViT15Weights; a string
selects a named entry from that enum.Explicit weight-enum member overriding
pretrained.**overridesobject= {}Per-field overrides forwarded to
CrossViTConfig.Returns
CrossViTForImageClassificationThe configured classifier.
Notes
Reference: Chen, Fan, and Panda, "CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification", ICCV 2021 (arXiv:2103.14899).