_wandb: value: cli_version: 0.28.1 e: kn5xozdbvyqfxelekw21y3irk9qbtqyy: args: - -of - /data/spatop/tttt_15M/configs/tttt15m_blocks.json - -l - /scratch/logs - -n - tttt15m_blocks cpu_count: 128 cpu_count_logical: 128 cudaVersion: "13.2" disk: /: total: "19999517310976" used: "2970750361600" email: danielprimosch@gmail.com executable: /opt/conda/bin/python gpu: NVIDIA A100-PCIE-40GB gpu_count: 1 gpu_nvidia: - architecture: Ampere cudaCores: 6912 memoryTotal: "42949672960" name: NVIDIA A100-PCIE-40GB uuid: GPU-99bafa4b-e33e-70d0-36ea-f0e1eb20fbc7 host: dp-tttt15m-train-blocks-8bd8w memory: total: "540711145472" os: Linux-6.8.0-134-generic-x86_64-with-glibc2.36 program: -m spanet.train python: CPython 3.12.10 root: /scratch/logs startedAt: "2026-08-11T13:25:03.575510Z" writerId: kn5xozdbvyqfxelekw21y3irk9qbtqyy m: - "1": trainer/global_step "6": - 3 "7": [] - "2": '*' "5": 1 "6": - 1 "7": [] python_version: 3.12.10 t: "1": - 1 - 5 - 9 - 53 - 103 "2": - 1 - 5 - 9 - 53 - 103 "3": - 7 - 13 - 41 - 66 "4": 3.12.10 "5": 0.28.1 "12": 0.28.1 "13": linux-x86_64 assignment_loss_scale: value: 1 balance_classifications: value: false balance_jets: value: 0 balance_losses: value: true balance_particles: value: 0 batch_size: value: 512 classification_loss_scale: value: 0 combinatorial_scale: value: 0 combine_pair_loss: value: min dataset_limit: value: 1 dataset_randomization: value: 0 detection_loss_scale: value: 1 dropout: value: 0.3 epochs: value: 15 event_info_file: value: /data/spatop/event_files/tttt/tttt_hadronic.yaml focal_gamma: value: 0 gradient_clip: value: 10 hidden_dim: value: 64 initial_embedding_dim: value: 64 initial_embedding_skip_connections: value: 1 kl_loss_scale: value: 0 l2_penalty: value: 0.0002 learning_rate: value: 0.00073 learning_rate_cycles: value: 1 learning_rate_warmup_epochs: value: 1 limit_to_num_jets: value: 0 limit_val_batches: value: 1 linear_activation: value: gelu linear_block_type: value: GRU linear_prelu_activation: value: true mask_sequence_vectors: value: 1 masking: value: Filling mass_classes: value: [] moe_loss_scale: value: 0.01 normalization: value: LayerNorm normalize_features: value: 1 num_attention_heads: value: 8 num_branch_embedding_layers: value: 3 num_branch_encoder_layers: value: 3 num_classification_layers: value: 3 num_dataloader_workers: value: 0 num_detector_layers: value: 2 num_embedding_layers: value: 10 num_encoder_layers: value: 4 num_experts: value: 8 num_experts_per_tok: value: 2 num_gpu: value: 1 num_jet_embedding_layers: value: 0 num_jet_encoder_layers: value: 2 num_pairwise_features: value: 4 num_regression_layers: value: 3 optimizer: value: AdamW pairwise_block_embeddings: value: 1 pairwise_cross_type: value: true pairwise_embedding_dim: value: 8 pairwise_eq2to2: value: false pairwise_feature_set: value: "" pairwise_input_source: value: all partial_events: value: 1 position_embedding_dim: value: 64 regression_loss_scale: value: 0 skip_connections: value: 1 split_symmetric_attention: value: 1 testing_file: value: "" train_validation_split: value: 0.95 training_file: value: /data/spatop/tttt_15M/h5/tttt_training.h5 transformer_activation: value: gelu transformer_dim: value: 64 transformer_dim_scale: value: 2 transformer_type: value: Gated trial_output_dir: value: ./test_output trial_time: value: "" usable_gpus: value: "" use_mass_classification: value: false use_moe: value: false use_pairwise_interactions: value: 1 validation_file: value: "" verbose_output: value: false