assignment_loss_scale: 1.0 balance_classifications: false balance_jets: 0 balance_losses: true balance_particles: 0 batch_size: 1024 classification_loss_scale: 0.0 combinatorial_scale: 0.0 combine_pair_loss: min dataset_limit: 1.0 dataset_randomization: 0 detection_loss_scale: 1.0 dropout: 0.2797850073316285 epochs: 100 event_info_file: /data/spatop/event_files/v11/tt_hadronic_v7_full.yaml focal_gamma: 0.0 gradient_clip: 10.0 hidden_dim: 128 initial_embedding_dim: 128 initial_embedding_skip_connections: 1 kl_loss_scale: 0.0 l2_penalty: 0.0002 learning_rate: 0.0003407775643879822 learning_rate_cycles: 1 learning_rate_warmup_epochs: 1.0 limit_to_num_jets: 0 limit_val_batches: 1.0 linear_activation: gelu linear_block_type: GRU linear_prelu_activation: true mask_sequence_vectors: 1 masking: Filling mass_classes: [] moe_loss_scale: 0.01 normalization: LayerNorm normalize_features: 1 num_attention_heads: 8 num_branch_embedding_layers: 3 num_branch_encoder_layers: 3 num_classification_layers: 3 num_dataloader_workers: 8 num_detector_layers: 2 num_embedding_layers: 10 num_encoder_layers: 4 num_experts: 8 num_experts_per_tok: 2 num_gpu: 1 num_jet_embedding_layers: 0 num_jet_encoder_layers: 2 num_pairwise_features: 4 num_regression_layers: 3 optimizer: AdamW pairwise_embedding_dim: 8 pairwise_input_source: '' partial_events: 1 position_embedding_dim: 128 regression_loss_scale: 0.0 skip_connections: 1 split_symmetric_attention: 1 testing_file: '' train_validation_split: 0.95 training_file: /data/spatop/tpm70_wpm30_FB350_fixed/all_merged.h5 transformer_activation: gelu transformer_dim: 128 transformer_dim_scale: 2.0 transformer_type: Gated trial_output_dir: ./test_output trial_time: '' usable_gpus: '' use_mass_classification: false use_moe: false use_pairwise_interactions: false validation_file: '' verbose_output: false