_wandb: value: cli_version: 0.28.1 e: a7hek814eoi9gsa23a72ksfjkbmksup7: args: - -of - /data/spatop/tttt_pilot/configs/tttt_vanilla.json - -l - /scratch/logs - -n - tttt_pilot_vanilla cpu_count: 64 cpu_count_logical: 64 cudaVersion: "13.2" disk: /: total: "1919959433216" used: "1424506851328" email: danielprimosch@gmail.com executable: /opt/conda/bin/python gpu: NVIDIA A100 80GB PCIe gpu_count: 1 gpu_nvidia: - architecture: Ampere cudaCores: 6912 memoryTotal: "85899345920" name: NVIDIA A100 80GB PCIe uuid: GPU-79e9234d-ec7c-e59c-b425-edaeb1d971af host: dp-tttt-train-vanilla-bbbs6 memory: total: "540455968768" os: Linux-6.8.0-136-generic-x86_64-with-glibc2.36 program: -m spanet.train python: CPython 3.12.10 root: /scratch/logs startedAt: "2026-08-10T18:41:36.053118Z" writerId: a7hek814eoi9gsa23a72ksfjkbmksup7 m: - "1": trainer/global_step "6": - 3 "7": [] - "2": '*' "5": 1 "6": - 1 "7": [] python_version: 3.12.10 t: "1": - 1 - 5 - 9 - 53 - 103 "2": - 1 - 5 - 9 - 53 - 103 "3": - 7 - 13 - 41 - 66 "4": 3.12.10 "5": 0.28.1 "12": 0.28.1 "13": linux-x86_64 assignment_loss_scale: value: 1 balance_classifications: value: false balance_jets: value: 0 balance_losses: value: true balance_particles: value: 0 batch_size: value: 256 classification_loss_scale: value: 0 combinatorial_scale: value: 0 combine_pair_loss: value: min dataset_limit: value: 1 dataset_randomization: value: 0 detection_loss_scale: value: 1 dropout: value: 0.3 epochs: value: 60 event_info_file: value: /data/spatop/event_files/tttt/tttt_hadronic.yaml focal_gamma: value: 0 gradient_clip: value: 10 hidden_dim: value: 64 initial_embedding_dim: value: 64 initial_embedding_skip_connections: value: 1 kl_loss_scale: value: 0 l2_penalty: value: 0.0002 learning_rate: value: 0.00073 learning_rate_cycles: value: 1 learning_rate_warmup_epochs: value: 2 limit_to_num_jets: value: 0 limit_val_batches: value: 1 linear_activation: value: gelu linear_block_type: value: GRU linear_prelu_activation: value: true mask_sequence_vectors: value: 1 masking: value: Filling mass_classes: value: [] moe_loss_scale: value: 0.01 normalization: value: LayerNorm normalize_features: value: 1 num_attention_heads: value: 8 num_branch_embedding_layers: value: 3 num_branch_encoder_layers: value: 3 num_classification_layers: value: 3 num_dataloader_workers: value: 0 num_detector_layers: value: 2 num_embedding_layers: value: 10 num_encoder_layers: value: 4 num_experts: value: 8 num_experts_per_tok: value: 2 num_gpu: value: 1 num_jet_embedding_layers: value: 0 num_jet_encoder_layers: value: 2 num_pairwise_features: value: 4 num_regression_layers: value: 3 optimizer: value: AdamW pairwise_embedding_dim: value: 8 pairwise_input_source: value: "" partial_events: value: 1 position_embedding_dim: value: 64 regression_loss_scale: value: 0 skip_connections: value: 1 split_symmetric_attention: value: 1 testing_file: value: "" train_validation_split: value: 0.9 training_file: value: /data/spatop/tttt_pilot/h5/tttt_training.h5 transformer_activation: value: gelu transformer_dim: value: 64 transformer_dim_scale: value: 2 transformer_type: value: Gated trial_output_dir: value: ./test_output trial_time: value: "" usable_gpus: value: "" use_mass_classification: value: false use_moe: value: false use_pairwise_interactions: value: false validation_file: value: "" verbose_output: value: false