{
    "hidden_dim": 64,
    "transformer_dim": 64,
    "transformer_dim_scale": 2.0,
    "initial_embedding_dim": 64,
    "position_embedding_dim": 64,
    "num_embedding_layers": 14,
    "num_encoder_layers": 4,
    "num_branch_embedding_layers": 3,
    "num_branch_encoder_layers": 3,
    "num_jet_embedding_layers": 0,
    "num_jet_encoder_layers": 2,
    "num_detector_layers": 2,
    "num_regression_layers": 3,
    "num_classification_layers": 3,
    "split_symmetric_attention": 1,
    "num_attention_heads": 8,
    "transformer_activation": "gelu",
    "skip_connections": 1,
    "initial_embedding_skip_connections": 1,
    "linear_block_type": "GRU",
    "transformer_type": "Gated",
    "linear_activation": "gelu",
    "normalization": "LayerNorm",
    "masking": "Filling",
    "linear_prelu_activation": 1,
    "use_pairwise_interactions": 1,
    "num_pairwise_features": 4,
    "pairwise_embedding_dim": 8,
    "pairwise_input_source": "",
    "pairwise_cross_type": 1,
    "use_moe": 0,
    "num_experts": 8,
    "num_experts_per_tok": 2,
    "moe_loss_scale": 0.01,
    "event_info_file": "/data/spatop/event_files/v11/tt_hadronic_v7_full.yaml",
    "training_file": "/data/spatop/tpm70_wpm30_FB350_training/all_merged.h5",
    "validation_file": "",
    "testing_file": "",
    "normalize_features": 1,
    "limit_to_num_jets": 0,
    "balance_particles": 0,
    "balance_jets": 0,
    "balance_classifications": 0,
    "partial_events": 1,
    "dataset_limit": 1.0,
    "dataset_randomization": 0,
    "train_validation_split": 0.95,
    "limit_val_batches": 1.0,
    "batch_size": 768,
    "num_dataloader_workers": 2,
    "mask_sequence_vectors": 1,
    "combine_pair_loss": "min",
    "optimizer": "AdamW",
    "learning_rate": 0.0007038152118366666,
    "focal_gamma": 0.0,
    "combinatorial_scale": 0.0,
    "learning_rate_warmup_epochs": 1.0,
    "learning_rate_cycles": 1,
    "assignment_loss_scale": 1.0,
    "detection_loss_scale": 1.0,
    "kl_loss_scale": 0.0,
    "regression_loss_scale": 0.0,
    "classification_loss_scale": 0.0,
    "use_mass_classification": 0,
    "mass_classes": [],
    "balance_losses": 1,
    "l2_penalty": 0.0002,
    "gradient_clip": 10.0,
    "dropout": 0.18304051459227696,
    "epochs": 500,
    "num_gpu": 1,
    "verbose_output": false,
    "usable_gpus": "",
    "trial_time": "",
    "trial_output_dir": "./test_output"
}