{
  "add_pooling_layer": true,
  "architectures": [
    "NapeForPreTraining"
  ],
  "attention_probs_dropout_prob": 0.0,
  "audio_duration": 10.0,
  "disable_target_stop_gradient": false,
  "drop_path_prob": 0.0,
  "dtype": "float32",
  "freq_bins": 128,
  "hidden_act": "gelu",
  "hidden_dropout_prob": 0.0,
  "hidden_size": 512,
  "hop_length": 160,
  "initializer_range": 0.02,
  "intermediate_size": 2048,
  "is_causal": true,
  "layer_norm_eps": 1e-12,
  "layerscale_value": 1e-05,
  "loss_type": "cosine",
  "mask_ratio": 0,
  "model_type": "nape",
  "n_mels": 128,
  "norm_type": "layernorm",
  "num_attention_heads": 8,
  "num_channels": 1,
  "num_hidden_layers": 6,
  "num_register_tokens": 0,
  "patch_embed_type": "conv2d",
  "patch_order": "raster",
  "patch_size": 16,
  "position_embedding_type": "rope",
  "prediction_head_type": "simsiam",
  "prediction_strategy": "single",
  "qk_norm": true,
  "qk_norm_affine": true,
  "qk_norm_bias": false,
  "qkv_bias": true,
  "raw_mel_normalize": true,
  "rope_theta": 100.0,
  "sample_rate": 16000,
  "sigreg_lambda": 0.1,
  "sigreg_max_tokens": 2048,
  "sigreg_num_knots": 17,
  "sigreg_num_slices": 1024,
  "sigreg_t_max": 5,
  "speech_stem_downsample": 2,
  "target_layer_index": 1,
  "target_time_frames": 1008,
  "target_type": "patch_embedding",
  "transformers_version": "4.56.2",
  "use_autoregressive_shift": true,
  "use_gated_mlp": false,
  "use_prediction_head": true,
  "use_sigreg": false
}