maxvit_xlarge_cls(pretrained: bool = False, overrides: object = {})MaxViT-XLarge image classifier (Tu et al., 2022).
Combines the maxvit_xlarge backbone (depths=(2, 6, 14, 2),
dims=(192, 384, 768, 1536)) with the reference NormMLP head.
~383.7M parameters — the largest MaxViT variant.
Model Size
Parameters
pretrainedbool= FalseIf
True, loads ImageNet-22k or JFT-300M pretrained weights
when available. Defaults to False.**overridesobject= {}Keyword overrides on top of the canonical MaxViT-XLarge config.
Returns
MaxViTForImageClassificationClassifier whose logits has shape (B, num_classes).
Notes
MaxViT-XLarge reaches 85.5% top-1 on ImageNet-1k at 224x224 (Tu et al., 2022, Table 6) and 88.5% at 512x512 after JFT-300M pretraining (Table 7) — the headline result of the paper.
Examples
>>> import lucid
>>> from lucid.models.vision.maxvit import maxvit_xlarge_cls
>>> model = maxvit_xlarge_cls(num_classes=1000)
>>> x = lucid.randn(1, 3, 224, 224)
>>> model(x).logits.shape
(1, 1000)