_wandb: value: cli_version: 0.28.0 e: w13l86grqc9gqnnxlcmc3yd9cpl9t8cy: args: - -of - /data/spatop/options_files/sweep/config_4hnzitok.json - -l - /data/spatop/logs/sweep - -n - sweep_4hnzitok cpu_count: 128 cpu_count_logical: 256 cudaVersion: "13.2" disk: /: total: "1599952912384" used: "1318315630592" email: escheuller@ucsd.edu executable: /opt/conda/bin/python gpu: NVIDIA A100-SXM4-80GB gpu_count: 1 gpu_nvidia: - architecture: Ampere cudaCores: 6912 memoryTotal: "85899345920" name: NVIDIA A100-SXM4-80GB uuid: GPU-e74daf6d-f33c-8090-04d4-25996e0a71d8 host: spatop-sweep-v2-88mpr memory: total: "1081702195200" os: Linux-6.8.0-111-generic-x86_64-with-glibc2.36 program: -m spanet.train python: CPython 3.12.10 root: /data/spatop/logs/sweep startedAt: "2026-06-29T10:42:19.157513Z" writerId: w13l86grqc9gqnnxlcmc3yd9cpl9t8cy m: - "1": trainer/global_step "6": - 3 "7": [] - "2": '*' "5": 1 "6": - 1 "7": [] python_version: 3.12.10 t: "1": - 1 - 5 - 9 - 53 - 103 "2": - 1 - 5 - 9 - 53 - 103 "3": - 5 - 7 - 13 - 14 - 41 - 62 - 66 "4": 3.12.10 "5": 0.28.0 "12": 0.28.0 "13": linux-x86_64 assignment_loss_scale: value: 1 balance_classifications: value: false balance_jets: value: 0 balance_losses: value: true balance_particles: value: 0 batch_size: value: 2048 classification_loss_scale: value: 0 combinatorial_scale: value: 0 combine_pair_loss: value: min dataset_limit: value: 1 dataset_randomization: value: 0 detection_loss_scale: value: 1 dropout: value: 0.2101490213720782 epochs: value: 100 event_info_file: value: /data/spatop/event_files/v11/tt_hadronic_v7_full.yaml focal_gamma: value: 0 gradient_clip: value: 10 hidden_dim: value: 64 initial_embedding_dim: value: 64 initial_embedding_skip_connections: value: 1 kl_loss_scale: value: 0 l2_penalty: value: 0.0002 learning_rate: value: 0.00084632367650264 learning_rate_cycles: value: 1 learning_rate_warmup_epochs: value: 1 limit_to_num_jets: value: 0 limit_val_batches: value: 1 linear_activation: value: gelu linear_block_type: value: GRU linear_prelu_activation: value: true mask_sequence_vectors: value: 1 masking: value: Filling mass_classes: value: [] moe_loss_scale: value: 0.01 normalization: value: LayerNorm normalize_features: value: 1 num_attention_heads: value: 8 num_branch_embedding_layers: value: 3 num_branch_encoder_layers: value: 3 num_classification_layers: value: 3 num_dataloader_workers: value: 8 num_detector_layers: value: 2 num_embedding_layers: value: 10 num_encoder_layers: value: 4 num_experts: value: 8 num_experts_per_tok: value: 2 num_gpu: value: 1 num_jet_embedding_layers: value: 0 num_jet_encoder_layers: value: 2 num_pairwise_features: value: 4 num_regression_layers: value: 3 optimizer: value: AdamW pairwise_embedding_dim: value: 8 pairwise_input_source: value: "" partial_events: value: 1 position_embedding_dim: value: 64 regression_loss_scale: value: 0 skip_connections: value: 1 split_symmetric_attention: value: 1 testing_file: value: "" train_validation_split: value: 0.95 training_file: value: /data/spatop/tpm70_wpm30_FB350_training/all_merged.h5 transformer_activation: value: gelu transformer_dim: value: 64 transformer_dim_scale: value: 2 transformer_type: value: Gated trial_output_dir: value: ./test_output trial_time: value: "" usable_gpus: value: "" use_mass_classification: value: false use_moe: value: false use_pairwise_interactions: value: false validation_file: value: "" verbose_output: value: false