_wandb: value: cli_version: 0.28.1 e: r5gkuwnyjbt6pb0uv8a8o6ri9qv8jzab: args: - -of - /data/spatop/options_files/sweep_fixed_dp/config_gs8pex8v_pwfix_mink.json - -l - /scratch/logs/ - -n - spatop_pwfix_mink_output cpu_count: 64 cpu_count_logical: 64 cudaVersion: "13.2" disk: /: total: "1648462135296" used: "650807914496" email: danielprimosch@gmail.com executable: /opt/conda/bin/python gpu: NVIDIA A100 80GB PCIe gpu_count: 1 gpu_nvidia: - architecture: Ampere cudaCores: 6912 memoryTotal: "85899345920" name: NVIDIA A100 80GB PCIe uuid: GPU-954fa517-a6da-e072-6979-9953530eb75f host: dp-spatop-train-pwfix-mink-2wvz8 memory: total: "810719399936" os: Linux-6.8.0-124-generic-x86_64-with-glibc2.36 program: -m spanet.train python: CPython 3.12.10 root: /scratch/logs/ startedAt: "2026-08-04T04:17:00.805292Z" writerId: r5gkuwnyjbt6pb0uv8a8o6ri9qv8jzab m: - "1": trainer/global_step "6": - 3 "7": [] - "2": '*' "5": 1 "6": - 1 "7": [] python_version: 3.12.10 t: "1": - 1 - 5 - 9 - 53 - 103 "2": - 1 - 5 - 9 - 53 - 103 "3": - 7 - 13 - 41 - 66 "4": 3.12.10 "5": 0.28.1 "12": 0.28.1 "13": linux-x86_64 assignment_loss_scale: value: 1 balance_classifications: value: false balance_jets: value: 0 balance_losses: value: true balance_particles: value: 0 batch_size: value: 512 classification_loss_scale: value: 0 combinatorial_scale: value: 0 combine_pair_loss: value: min dataset_limit: value: 1 dataset_randomization: value: 0 detection_loss_scale: value: 1 dropout: value: 0.2978723651141102 epochs: value: 50 event_info_file: value: /data/spatop/event_files/v11/tt_hadronic_v7_full.yaml focal_gamma: value: 0 gradient_clip: value: 10 hidden_dim: value: 64 initial_embedding_dim: value: 64 initial_embedding_skip_connections: value: 1 kl_loss_scale: value: 0 l2_penalty: value: 0.0002 learning_rate: value: 0.0007344299982717679 learning_rate_cycles: value: 1 learning_rate_warmup_epochs: value: 1 limit_to_num_jets: value: 0 limit_val_batches: value: 1 linear_activation: value: gelu linear_block_type: value: GRU linear_prelu_activation: value: true mask_sequence_vectors: value: 1 masking: value: Filling mass_classes: value: [] moe_loss_scale: value: 0.01 normalization: value: LayerNorm normalize_features: value: 1 num_attention_heads: value: 8 num_branch_embedding_layers: value: 3 num_branch_encoder_layers: value: 3 num_classification_layers: value: 3 num_dataloader_workers: value: 0 num_detector_layers: value: 2 num_embedding_layers: value: 10 num_encoder_layers: value: 4 num_experts: value: 8 num_experts_per_tok: value: 2 num_gpu: value: 1 num_jet_embedding_layers: value: 0 num_jet_encoder_layers: value: 2 num_pairwise_features: value: 4 num_regression_layers: value: 3 optimizer: value: AdamW pairwise_block_embeddings: value: 1 pairwise_cross_type: value: true pairwise_embedding_dim: value: 8 pairwise_eq2to2: value: false pairwise_feature_set: value: mink pairwise_input_source: value: all partial_events: value: 1 position_embedding_dim: value: 64 regression_loss_scale: value: 0 skip_connections: value: 1 split_symmetric_attention: value: 1 testing_file: value: "" train_validation_split: value: 0.95 training_file: value: /data/spatop/tpm70_wpm30_FB350_fixed/all_merged.h5 transformer_activation: value: gelu transformer_dim: value: 64 transformer_dim_scale: value: 2 transformer_type: value: Gated trial_output_dir: value: ./test_output trial_time: value: "" usable_gpus: value: "" use_mass_classification: value: false use_moe: value: false use_pairwise_interactions: value: 1 validation_file: value: "" verbose_output: value: false