data
Mask2FormerConfig
extends
ModelConfigMask2FormerConfig(num_classes: int = 150, in_channels: int = 3, swin_embed_dim: int = 96, swin_depths: tuple[int, int, int, int] = (2, 2, 6, 2), swin_num_heads: tuple[int, int, int, int] = (3, 6, 12, 24), swin_window_size: int = 7, swin_mlp_ratio: float = 4.0, d_model: int = 256, mask_feature_size: int = 256, n_head: int = 8, num_encoder_layers: int = 6, encoder_feedforward_dim: int = 1024, num_decoder_layers: int = 10, dim_feedforward: int = 2048, dropout: float = 0.0, num_queries: int = 100, num_feature_levels: int = 3, feature_strides: tuple[int, int, int, int] = (4, 8, 16, 32), common_stride: int = 4)Configuration for Mask2Former (Cheng et al., CVPR 2022).
The field set mirrors the reference framework's Mask2FormerConfig
so the pretrained-weight converter is a near-identity key map. The
pipeline is:
Image → Swin backbone → [stage1..4] feature maps → MSDeformAttn pixel decoder → 3 multi-scale memory levels + 1/4-scale mask features → 9-layer masked-attention transformer decoder (cycling levels) → class head (Linear → K+1) + mask head (MLP → dot mask features)
Parameters
num_classesint= 150Number of semantic classes (foreground; the
class head emits
num_classes + 1).in_channelsint= 3Input image channels.
swin_embed_dimint= 96Swin patch-embedding dimension.
swin_depthstuple[int, int, int, int]= (2, 2, 6, 2)Swin per-stage block counts.
swin_num_headstuple[int, int, int, int]= (3, 6, 12, 24)Swin per-stage head counts.
swin_window_sizeint= 7Swin attention window size.
swin_mlp_ratiofloat= 4.0Swin MLP expansion ratio.
d_modelint= 256Transformer / pixel-decoder feature dim.
mask_feature_sizeint= 256Per-pixel mask-feature channel width.
n_headint= 8Number of attention heads.
num_encoder_layersint= 6Deformable pixel-decoder encoder depth.
encoder_feedforward_dimint= 1024Pixel-decoder FFN inner dim.
num_decoder_layersint= 10Transformer decoder depth (the decoder uses
num_decoder_layers - 1 masked layers; the
extra slot is the pre-layer mask prediction).dim_feedforwardint= 2048Transformer-decoder FFN inner dim.
dropoutfloat= 0.0Dropout probability (0 at inference).
num_queriesint= 100Number of learnable object queries N.
num_feature_levelsint= 3Number of multi-scale memory levels (3).
feature_stridestuple[int, int, int, int]= (4, 8, 16, 32)Backbone output strides.
common_strideint= 4Finest pixel-decoder stride.
Used by 3
Constructors
1dunder
__init__
→None__init__(num_classes: int = 150, in_channels: int = 3, swin_embed_dim: int = 96, swin_depths: tuple[int, int, int, int] = (2, 2, 6, 2), swin_num_heads: tuple[int, int, int, int] = (3, 6, 12, 24), swin_window_size: int = 7, swin_mlp_ratio: float = 4.0, d_model: int = 256, mask_feature_size: int = 256, n_head: int = 8, num_encoder_layers: int = 6, encoder_feedforward_dim: int = 1024, num_decoder_layers: int = 10, dim_feedforward: int = 2048, dropout: float = 0.0, num_queries: int = 100, num_feature_levels: int = 3, feature_strides: tuple[int, int, int, int] = (4, 8, 16, 32), common_stride: int = 4)