crossvit_9_cls(pretrained: bool | str = False, weights: CrossViT9Weights | None = None, overrides: object = {})CrossViT-9 image classifier — embed_dims=(128, 256), depths
((1, 3, 0)) x 3, 4 heads per branch. ~8.6M params; paper
Table 2 reports 73.9% ImageNet-1k top-1 at 240x240.
Model Size
Parameters
pretrainedbool or str= FalseFalse returns randomly-initialised weights; True loads
the default entry of CrossViT9Weights; a string
selects a named entry from that enum.Explicit weight-enum member overriding
pretrained.**overridesobject= {}Per-field overrides forwarded to
CrossViTConfig.Returns
CrossViTForImageClassificationThe configured classifier.
Notes
Reference: Chen, Fan, and Panda, "CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification", ICCV 2021 (arXiv:2103.14899).