{
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.0016131373909115839,
  "eval_steps": 13,
  "global_step": 50,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 3.226274781823168e-05,
      "grad_norm": NaN,
      "learning_rate": 5e-06,
      "loss": 0.0,
      "step": 1
    },
    {
      "epoch": 3.226274781823168e-05,
      "eval_loss": NaN,
      "eval_runtime": 613.6846,
      "eval_samples_per_second": 21.267,
      "eval_steps_per_second": 10.634,
      "step": 1
    },
    {
      "epoch": 6.452549563646336e-05,
      "grad_norm": NaN,
      "learning_rate": 1e-05,
      "loss": 0.0,
      "step": 2
    },
    {
      "epoch": 9.678824345469504e-05,
      "grad_norm": NaN,
      "learning_rate": 1.5e-05,
      "loss": 0.0,
      "step": 3
    },
    {
      "epoch": 0.00012905099127292672,
      "grad_norm": NaN,
      "learning_rate": 2e-05,
      "loss": 0.0,
      "step": 4
    },
    {
      "epoch": 0.0001613137390911584,
      "grad_norm": NaN,
      "learning_rate": 2.5e-05,
      "loss": 0.0,
      "step": 5
    },
    {
      "epoch": 0.00019357648690939008,
      "grad_norm": NaN,
      "learning_rate": 3e-05,
      "loss": 0.0,
      "step": 6
    },
    {
      "epoch": 0.00022583923472762176,
      "grad_norm": NaN,
      "learning_rate": 3.5e-05,
      "loss": 0.0,
      "step": 7
    },
    {
      "epoch": 0.00025810198254585344,
      "grad_norm": NaN,
      "learning_rate": 4e-05,
      "loss": 0.0,
      "step": 8
    },
    {
      "epoch": 0.0002903647303640851,
      "grad_norm": NaN,
      "learning_rate": 4.5e-05,
      "loss": 0.0,
      "step": 9
    },
    {
      "epoch": 0.0003226274781823168,
      "grad_norm": NaN,
      "learning_rate": 5e-05,
      "loss": 0.0,
      "step": 10
    },
    {
      "epoch": 0.0003548902260005485,
      "grad_norm": NaN,
      "learning_rate": 4.99229333433282e-05,
      "loss": 0.0,
      "step": 11
    },
    {
      "epoch": 0.00038715297381878015,
      "grad_norm": NaN,
      "learning_rate": 4.9692208514878444e-05,
      "loss": 0.0,
      "step": 12
    },
    {
      "epoch": 0.00041941572163701183,
      "grad_norm": NaN,
      "learning_rate": 4.9309248009941914e-05,
      "loss": 0.0,
      "step": 13
    },
    {
      "epoch": 0.00041941572163701183,
      "eval_loss": NaN,
      "eval_runtime": 611.7786,
      "eval_samples_per_second": 21.333,
      "eval_steps_per_second": 10.667,
      "step": 13
    },
    {
      "epoch": 0.0004516784694552435,
      "grad_norm": NaN,
      "learning_rate": 4.877641290737884e-05,
      "loss": 0.0,
      "step": 14
    },
    {
      "epoch": 0.0004839412172734752,
      "grad_norm": NaN,
      "learning_rate": 4.8096988312782174e-05,
      "loss": 0.0,
      "step": 15
    },
    {
      "epoch": 0.0005162039650917069,
      "grad_norm": NaN,
      "learning_rate": 4.72751631047092e-05,
      "loss": 0.0,
      "step": 16
    },
    {
      "epoch": 0.0005484667129099385,
      "grad_norm": NaN,
      "learning_rate": 4.6316004108852305e-05,
      "loss": 0.0,
      "step": 17
    },
    {
      "epoch": 0.0005807294607281702,
      "grad_norm": NaN,
      "learning_rate": 4.522542485937369e-05,
      "loss": 0.0,
      "step": 18
    },
    {
      "epoch": 0.0006129922085464019,
      "grad_norm": NaN,
      "learning_rate": 4.401014914000078e-05,
      "loss": 0.0,
      "step": 19
    },
    {
      "epoch": 0.0006452549563646336,
      "grad_norm": NaN,
      "learning_rate": 4.267766952966369e-05,
      "loss": 0.0,
      "step": 20
    },
    {
      "epoch": 0.0006775177041828652,
      "grad_norm": NaN,
      "learning_rate": 4.123620120825459e-05,
      "loss": 0.0,
      "step": 21
    },
    {
      "epoch": 0.000709780452001097,
      "grad_norm": NaN,
      "learning_rate": 3.969463130731183e-05,
      "loss": 0.0,
      "step": 22
    },
    {
      "epoch": 0.0007420431998193286,
      "grad_norm": NaN,
      "learning_rate": 3.8062464117898724e-05,
      "loss": 0.0,
      "step": 23
    },
    {
      "epoch": 0.0007743059476375603,
      "grad_norm": NaN,
      "learning_rate": 3.634976249348867e-05,
      "loss": 0.0,
      "step": 24
    },
    {
      "epoch": 0.0008065686954557919,
      "grad_norm": NaN,
      "learning_rate": 3.456708580912725e-05,
      "loss": 0.0,
      "step": 25
    },
    {
      "epoch": 0.0008388314432740237,
      "grad_norm": NaN,
      "learning_rate": 3.272542485937369e-05,
      "loss": 0.0,
      "step": 26
    },
    {
      "epoch": 0.0008388314432740237,
      "eval_loss": NaN,
      "eval_runtime": 611.9971,
      "eval_samples_per_second": 21.325,
      "eval_steps_per_second": 10.663,
      "step": 26
    },
    {
      "epoch": 0.0008710941910922553,
      "grad_norm": NaN,
      "learning_rate": 3.083613409639764e-05,
      "loss": 0.0,
      "step": 27
    },
    {
      "epoch": 0.000903356938910487,
      "grad_norm": NaN,
      "learning_rate": 2.8910861626005776e-05,
      "loss": 0.0,
      "step": 28
    },
    {
      "epoch": 0.0009356196867287187,
      "grad_norm": NaN,
      "learning_rate": 2.6961477393196126e-05,
      "loss": 0.0,
      "step": 29
    },
    {
      "epoch": 0.0009678824345469504,
      "grad_norm": NaN,
      "learning_rate": 2.5e-05,
      "loss": 0.0,
      "step": 30
    },
    {
      "epoch": 0.001000145182365182,
      "grad_norm": NaN,
      "learning_rate": 2.303852260680388e-05,
      "loss": 0.0,
      "step": 31
    },
    {
      "epoch": 0.0010324079301834137,
      "grad_norm": NaN,
      "learning_rate": 2.1089138373994223e-05,
      "loss": 0.0,
      "step": 32
    },
    {
      "epoch": 0.0010646706780016455,
      "grad_norm": NaN,
      "learning_rate": 1.9163865903602374e-05,
      "loss": 0.0,
      "step": 33
    },
    {
      "epoch": 0.001096933425819877,
      "grad_norm": NaN,
      "learning_rate": 1.7274575140626318e-05,
      "loss": 0.0,
      "step": 34
    },
    {
      "epoch": 0.0011291961736381087,
      "grad_norm": NaN,
      "learning_rate": 1.5432914190872757e-05,
      "loss": 0.0,
      "step": 35
    },
    {
      "epoch": 0.0011614589214563405,
      "grad_norm": NaN,
      "learning_rate": 1.3650237506511331e-05,
      "loss": 0.0,
      "step": 36
    },
    {
      "epoch": 0.0011937216692745722,
      "grad_norm": NaN,
      "learning_rate": 1.1937535882101281e-05,
      "loss": 0.0,
      "step": 37
    },
    {
      "epoch": 0.0012259844170928037,
      "grad_norm": NaN,
      "learning_rate": 1.0305368692688174e-05,
      "loss": 0.0,
      "step": 38
    },
    {
      "epoch": 0.0012582471649110354,
      "grad_norm": NaN,
      "learning_rate": 8.763798791745411e-06,
      "loss": 0.0,
      "step": 39
    },
    {
      "epoch": 0.0012582471649110354,
      "eval_loss": NaN,
      "eval_runtime": 612.0917,
      "eval_samples_per_second": 21.322,
      "eval_steps_per_second": 10.662,
      "step": 39
    },
    {
      "epoch": 0.0012905099127292672,
      "grad_norm": NaN,
      "learning_rate": 7.3223304703363135e-06,
      "loss": 0.0,
      "step": 40
    },
    {
      "epoch": 0.001322772660547499,
      "grad_norm": NaN,
      "learning_rate": 5.989850859999227e-06,
      "loss": 0.0,
      "step": 41
    },
    {
      "epoch": 0.0013550354083657304,
      "grad_norm": NaN,
      "learning_rate": 4.7745751406263165e-06,
      "loss": 0.0,
      "step": 42
    },
    {
      "epoch": 0.0013872981561839622,
      "grad_norm": NaN,
      "learning_rate": 3.6839958911476957e-06,
      "loss": 0.0,
      "step": 43
    },
    {
      "epoch": 0.001419560904002194,
      "grad_norm": NaN,
      "learning_rate": 2.7248368952908053e-06,
      "loss": 0.0,
      "step": 44
    },
    {
      "epoch": 0.0014518236518204256,
      "grad_norm": NaN,
      "learning_rate": 1.9030116872178316e-06,
      "loss": 0.0,
      "step": 45
    },
    {
      "epoch": 0.0014840863996386571,
      "grad_norm": NaN,
      "learning_rate": 1.2235870926211619e-06,
      "loss": 0.0,
      "step": 46
    },
    {
      "epoch": 0.0015163491474568889,
      "grad_norm": NaN,
      "learning_rate": 6.907519900580861e-07,
      "loss": 0.0,
      "step": 47
    },
    {
      "epoch": 0.0015486118952751206,
      "grad_norm": NaN,
      "learning_rate": 3.077914851215585e-07,
      "loss": 0.0,
      "step": 48
    },
    {
      "epoch": 0.0015808746430933523,
      "grad_norm": NaN,
      "learning_rate": 7.706665667180091e-08,
      "loss": 0.0,
      "step": 49
    },
    {
      "epoch": 0.0016131373909115839,
      "grad_norm": NaN,
      "learning_rate": 0.0,
      "loss": 0.0,
      "step": 50
    }
  ],
  "logging_steps": 1,
  "max_steps": 50,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 1,
  "save_steps": 13,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 1.49734957252608e+16,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}