_wandb: value: cli_version: 0.28.2 e: jvd38a055jb1sso60bcpnpvop1mzd33q: args: - -of - /data/spatop/options_files/v11/spatop_legacyfr_v6.json - -l - /scratch/logs/ - -n - spatop_legacyfr_v6_output cpu_count: 128 cpu_count_logical: 256 cudaVersion: "13.2" disk: /: total: "1599952912384" used: "1236162772992" email: danielprimosch@gmail.com executable: /opt/conda/bin/python gpu: NVIDIA A100-SXM4-80GB gpu_count: 1 gpu_nvidia: - architecture: Ampere cudaCores: 6912 memoryTotal: "85899345920" name: NVIDIA A100-SXM4-80GB uuid: GPU-e477ea48-7ddf-dba1-d7fd-e6cb06b29150 host: dp-spatop-train-legacyfr-v6-mf7n8 memory: total: "1081702117376" os: Linux-6.8.0-137-generic-x86_64-with-glibc2.36 program: -m spanet.train python: CPython 3.12.10 root: /scratch/logs/ startedAt: "2026-08-13T22:05:13.184779Z" writerId: jvd38a055jb1sso60bcpnpvop1mzd33q m: - "1": trainer/global_step "6": - 3 "7": [] - "2": '*' "5": 1 "6": - 1 "7": [] python_version: 3.12.10 t: "1": - 1 - 5 - 9 - 53 - 103 "2": - 1 - 5 - 9 - 53 - 103 "3": - 7 - 13 - 41 - 66 "4": 3.12.10 "5": 0.28.2 "12": 0.28.2 "13": linux-x86_64 assignment_loss_scale: value: 1 balance_classifications: value: false balance_jets: value: 0 balance_losses: value: true balance_particles: value: 1 batch_size: value: 2048 classification_loss_scale: value: 0 combinatorial_scale: value: 0 combine_pair_loss: value: min dataset_limit: value: 1 dataset_randomization: value: 0 detection_loss_scale: value: 1 dropout: value: 0 epochs: value: 50 event_info_file: value: /data/spatop/event_files/v11/tt_hadronic_fr_only.yaml focal_gamma: value: 0 gradient_clip: value: 0 hidden_dim: value: 64 initial_embedding_dim: value: 16 initial_embedding_skip_connections: value: 1 kl_loss_scale: value: 0 l2_penalty: value: 0.0002 learning_rate: value: 0.0015 learning_rate_cycles: value: 1 learning_rate_warmup_epochs: value: 1 limit_to_num_jets: value: 0 limit_val_batches: value: 1 linear_activation: value: gelu linear_block_type: value: GRU linear_prelu_activation: value: true mask_sequence_vectors: value: 1 masking: value: Filling mass_classes: value: [] moe_loss_scale: value: 0.01 normalization: value: LayerNorm normalize_features: value: 1 num_attention_heads: value: 4 num_branch_embedding_layers: value: 3 num_branch_encoder_layers: value: 3 num_classification_layers: value: 3 num_dataloader_workers: value: 0 num_detector_layers: value: 2 num_embedding_layers: value: 10 num_encoder_layers: value: 6 num_experts: value: 8 num_experts_per_tok: value: 2 num_gpu: value: 1 num_jet_embedding_layers: value: 0 num_jet_encoder_layers: value: 2 num_pairwise_features: value: 4 num_regression_layers: value: 3 optimizer: value: AdamW pairwise_embedding_dim: value: 8 pairwise_input_source: value: "" partial_events: value: 1 position_embedding_dim: value: 32 regression_loss_scale: value: 0 skip_connections: value: 1 split_symmetric_attention: value: 1 testing_file: value: "" train_validation_split: value: 0.95 training_file: value: /data/spatop/delphes_v6/tt_hadronic_training2k_clean.h5 transformer_activation: value: gelu transformer_dim: value: 64 transformer_dim_scale: value: 2 transformer_type: value: Gated trial_output_dir: value: ./test_output trial_time: value: "" usable_gpus: value: "" use_mass_classification: value: false use_moe: value: false use_pairwise_interactions: value: false validation_file: value: "" verbose_output: value: false