{
  "source_commit": "856c9cb4f32a3edf40ce62e0462585e51f7f44c1",
  "binding": "2326ad76aeff49358ae3d0ba78f73b8fc66fae1a6e2d9e291eb7c32cdc520260",
  "full_model_parameters": 1711376384,
  "workers": 2,
  "completed_steps": 12,
  "dense_warmup_updates": 8,
  "compressed_updates": 4,
  "same_parameter_digest": "242d50b2ec9850394fbbad82174d61ae65cc8287e8a487fe910f81fdbbfe8642",
  "peak_cuda_allocated_GiB": 36.88682556152344,
  "upstream_per_rank_logical_stats": {
    "original_elements": 6845505536,
    "ratio": 45.13763301463836,
    "transmitted_elements": 151658496
  },
  "whole_host_sent_GB_during_probe": 120.388041837,
  "scope": "Training-only memory and rank-agreement feasibility. Whole-host counters include concurrent operator artifact transfers, so they do not isolate compression traffic. Logical stats exclude dense warmup, initial broadcast and transport overhead. No held-out quality evaluation, native promotion, token issuance or complete compression-state recovery."
}
