{ "best_metric": null, "best_model_checkpoint": null, "epoch": 342.8300220750552, "eval_steps": 500, "global_step": 38740, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 4.406181015452539, "grad_norm": 0.8222458958625793, "learning_rate": 4.9500000000000004e-05, "loss": 3.9899, "step": 500 }, { "epoch": 8.794701986754967, "grad_norm": 0.9474080204963684, "learning_rate": 4.9e-05, "loss": 3.7024, "step": 1000 }, { "epoch": 13.176600441501105, "grad_norm": 1.0692858695983887, "learning_rate": 4.85e-05, "loss": 3.4284, "step": 1500 }, { "epoch": 17.56512141280353, "grad_norm": 1.097322940826416, "learning_rate": 4.8e-05, "loss": 3.1904, "step": 2000 }, { "epoch": 21.95364238410596, "grad_norm": 1.2007817029953003, "learning_rate": 4.75e-05, "loss": 2.9764, "step": 2500 }, { "epoch": 26.335540838852097, "grad_norm": 1.2675273418426514, "learning_rate": 4.7e-05, "loss": 2.7812, "step": 3000 }, { "epoch": 30.724061810154524, "grad_norm": 1.2794780731201172, "learning_rate": 4.6500000000000005e-05, "loss": 2.6072, "step": 3500 }, { "epoch": 35.38852097130243, "grad_norm": 1.3926743268966675, "learning_rate": 4.600000000000001e-05, "loss": 2.4002, "step": 4000 }, { "epoch": 39.77704194260485, "grad_norm": 1.3976378440856934, "learning_rate": 4.55e-05, "loss": 2.2963, "step": 4500 }, { "epoch": 44.158940397350996, "grad_norm": 1.4675860404968262, "learning_rate": 4.5e-05, "loss": 2.1558, "step": 5000 }, { "epoch": 48.54746136865342, "grad_norm": 1.4536672830581665, "learning_rate": 4.4500000000000004e-05, "loss": 2.0227, "step": 5500 }, { "epoch": 52.93598233995585, "grad_norm": 1.4907385110855103, "learning_rate": 4.4000000000000006e-05, "loss": 1.9043, "step": 6000 }, { "epoch": 57.317880794701985, "grad_norm": 1.5043652057647705, "learning_rate": 4.35e-05, "loss": 1.7846, "step": 6500 }, { "epoch": 61.70640176600442, "grad_norm": 1.5272749662399292, "learning_rate": 4.3e-05, "loss": 1.6737, "step": 7000 }, { "epoch": 66.08830022075055, "grad_norm": 1.5962594747543335, "learning_rate": 4.25e-05, "loss": 1.5731, "step": 7500 }, { "epoch": 70.47682119205298, "grad_norm": 1.5520045757293701, "learning_rate": 4.2e-05, "loss": 1.4763, "step": 8000 }, { "epoch": 74.86534216335541, "grad_norm": 1.5050873756408691, "learning_rate": 4.15e-05, "loss": 1.3849, "step": 8500 }, { "epoch": 79.24724061810154, "grad_norm": 1.593792200088501, "learning_rate": 4.1e-05, "loss": 1.297, "step": 9000 }, { "epoch": 83.63576158940397, "grad_norm": 1.6733592748641968, "learning_rate": 4.05e-05, "loss": 1.2148, "step": 9500 }, { "epoch": 88.0176600441501, "grad_norm": 1.5692708492279053, "learning_rate": 4e-05, "loss": 1.139, "step": 10000 }, { "epoch": 92.40618101545253, "grad_norm": 1.6074855327606201, "learning_rate": 3.9500000000000005e-05, "loss": 1.062, "step": 10500 }, { "epoch": 96.79470198675497, "grad_norm": 1.6174248456954956, "learning_rate": 3.9000000000000006e-05, "loss": 0.9947, "step": 11000 }, { "epoch": 101.17660044150111, "grad_norm": 1.6355832815170288, "learning_rate": 3.85e-05, "loss": 0.9289, "step": 11500 }, { "epoch": 105.56512141280353, "grad_norm": 1.5573843717575073, "learning_rate": 3.8e-05, "loss": 0.8648, "step": 12000 }, { "epoch": 109.95364238410596, "grad_norm": 1.6609675884246826, "learning_rate": 3.7500000000000003e-05, "loss": 0.8105, "step": 12500 }, { "epoch": 114.3355408388521, "grad_norm": 1.5728868246078491, "learning_rate": 3.7e-05, "loss": 0.7535, "step": 13000 }, { "epoch": 118.72406181015452, "grad_norm": 1.6245304346084595, "learning_rate": 3.65e-05, "loss": 0.7034, "step": 13500 }, { "epoch": 123.10596026490066, "grad_norm": 1.593719482421875, "learning_rate": 3.6e-05, "loss": 0.6554, "step": 14000 }, { "epoch": 127.49448123620309, "grad_norm": 1.6109435558319092, "learning_rate": 3.55e-05, "loss": 0.6112, "step": 14500 }, { "epoch": 131.8830022075055, "grad_norm": 1.6921696662902832, "learning_rate": 3.5e-05, "loss": 0.5707, "step": 15000 }, { "epoch": 136.26490066225165, "grad_norm": 1.6247228384017944, "learning_rate": 3.45e-05, "loss": 0.5321, "step": 15500 }, { "epoch": 140.65342163355407, "grad_norm": 1.6326526403427124, "learning_rate": 3.4000000000000007e-05, "loss": 0.4967, "step": 16000 }, { "epoch": 145.0353200883002, "grad_norm": 1.4845603704452515, "learning_rate": 3.35e-05, "loss": 0.4649, "step": 16500 }, { "epoch": 149.42384105960264, "grad_norm": 1.5263372659683228, "learning_rate": 3.3e-05, "loss": 0.4334, "step": 17000 }, { "epoch": 153.81236203090506, "grad_norm": 1.411693811416626, "learning_rate": 3.2500000000000004e-05, "loss": 0.407, "step": 17500 }, { "epoch": 158.19426048565123, "grad_norm": 1.459270715713501, "learning_rate": 3.2000000000000005e-05, "loss": 0.3815, "step": 18000 }, { "epoch": 162.58278145695365, "grad_norm": 1.5529966354370117, "learning_rate": 3.15e-05, "loss": 0.3581, "step": 18500 }, { "epoch": 166.97130242825608, "grad_norm": 1.432273268699646, "learning_rate": 3.1e-05, "loss": 0.3373, "step": 19000 }, { "epoch": 171.35320088300222, "grad_norm": 1.3730608224868774, "learning_rate": 3.05e-05, "loss": 0.3169, "step": 19500 }, { "epoch": 175.74172185430464, "grad_norm": 1.4327744245529175, "learning_rate": 3e-05, "loss": 0.2998, "step": 20000 }, { "epoch": 180.12362030905078, "grad_norm": 1.3872003555297852, "learning_rate": 2.95e-05, "loss": 0.2831, "step": 20500 }, { "epoch": 184.5121412803532, "grad_norm": 1.3601843118667603, "learning_rate": 2.9e-05, "loss": 0.2674, "step": 21000 }, { "epoch": 188.90066225165563, "grad_norm": 1.278759241104126, "learning_rate": 2.8499999999999998e-05, "loss": 0.2546, "step": 21500 }, { "epoch": 193.28256070640177, "grad_norm": 1.3242909908294678, "learning_rate": 2.8000000000000003e-05, "loss": 0.2415, "step": 22000 }, { "epoch": 197.6710816777042, "grad_norm": 1.29855477809906, "learning_rate": 2.7500000000000004e-05, "loss": 0.2295, "step": 22500 }, { "epoch": 202.05298013245033, "grad_norm": 1.1802529096603394, "learning_rate": 2.7000000000000002e-05, "loss": 0.2193, "step": 23000 }, { "epoch": 206.44150110375276, "grad_norm": 1.230195164680481, "learning_rate": 2.6500000000000004e-05, "loss": 0.2084, "step": 23500 }, { "epoch": 212.37969094922738, "grad_norm": 1.2718374729156494, "learning_rate": 2.6000000000000002e-05, "loss": 0.1966, "step": 24000 }, { "epoch": 216.7682119205298, "grad_norm": 1.2735928297042847, "learning_rate": 2.5500000000000003e-05, "loss": 0.1911, "step": 24500 }, { "epoch": 221.15011037527594, "grad_norm": 1.1786949634552002, "learning_rate": 2.5e-05, "loss": 0.1832, "step": 25000 }, { "epoch": 225.53863134657837, "grad_norm": 1.1616557836532593, "learning_rate": 2.45e-05, "loss": 0.1751, "step": 25500 }, { "epoch": 229.9271523178808, "grad_norm": 1.1504043340682983, "learning_rate": 2.4e-05, "loss": 0.1688, "step": 26000 }, { "epoch": 234.48565121412804, "grad_norm": 1.1552656888961792, "learning_rate": 2.35e-05, "loss": 0.1618, "step": 26500 }, { "epoch": 238.87417218543047, "grad_norm": 1.1210813522338867, "learning_rate": 2.3000000000000003e-05, "loss": 0.1561, "step": 27000 }, { "epoch": 243.2560706401766, "grad_norm": 1.1037412881851196, "learning_rate": 2.25e-05, "loss": 0.1502, "step": 27500 }, { "epoch": 247.64459161147903, "grad_norm": 1.0126384496688843, "learning_rate": 2.2000000000000003e-05, "loss": 0.1448, "step": 28000 }, { "epoch": 252.19426048565123, "grad_norm": 1.0003942251205444, "learning_rate": 2.15e-05, "loss": 0.1394, "step": 28500 }, { "epoch": 256.5827814569536, "grad_norm": 1.0045232772827148, "learning_rate": 2.1e-05, "loss": 0.1352, "step": 29000 }, { "epoch": 260.9713024282561, "grad_norm": 1.046236515045166, "learning_rate": 2.05e-05, "loss": 0.1314, "step": 29500 }, { "epoch": 265.48565121412804, "grad_norm": 0.9956527352333069, "learning_rate": 2e-05, "loss": 0.1257, "step": 30000 }, { "epoch": 269.87417218543044, "grad_norm": 1.0047001838684082, "learning_rate": 1.9500000000000003e-05, "loss": 0.1229, "step": 30500 }, { "epoch": 274.3355408388521, "grad_norm": 0.9991653561592102, "learning_rate": 1.9e-05, "loss": 0.1184, "step": 31000 }, { "epoch": 278.7240618101545, "grad_norm": 0.958787202835083, "learning_rate": 1.85e-05, "loss": 0.1155, "step": 31500 }, { "epoch": 283.10596026490066, "grad_norm": 0.9622847437858582, "learning_rate": 1.8e-05, "loss": 0.1121, "step": 32000 }, { "epoch": 287.4944812362031, "grad_norm": 0.9591727256774902, "learning_rate": 1.75e-05, "loss": 0.1093, "step": 32500 }, { "epoch": 291.8830022075055, "grad_norm": 1.010334849357605, "learning_rate": 1.7000000000000003e-05, "loss": 0.1061, "step": 33000 }, { "epoch": 296.26490066225165, "grad_norm": 0.974038302898407, "learning_rate": 1.65e-05, "loss": 0.1031, "step": 33500 }, { "epoch": 300.6534216335541, "grad_norm": 0.9348180890083313, "learning_rate": 1.6000000000000003e-05, "loss": 0.1007, "step": 34000 }, { "epoch": 305.03532008830024, "grad_norm": 0.9226692318916321, "learning_rate": 1.55e-05, "loss": 0.0983, "step": 34500 }, { "epoch": 309.42384105960264, "grad_norm": 0.9339843988418579, "learning_rate": 1.5e-05, "loss": 0.0957, "step": 35000 }, { "epoch": 313.8123620309051, "grad_norm": 0.9748533368110657, "learning_rate": 1.45e-05, "loss": 0.0934, "step": 35500 }, { "epoch": 318.5827814569536, "grad_norm": 0.8408458828926086, "learning_rate": 1.4000000000000001e-05, "loss": 0.0903, "step": 36000 }, { "epoch": 322.9713024282561, "grad_norm": 0.9094577431678772, "learning_rate": 1.3500000000000001e-05, "loss": 0.0893, "step": 36500 }, { "epoch": 327.3532008830022, "grad_norm": 0.9151813387870789, "learning_rate": 1.3000000000000001e-05, "loss": 0.0875, "step": 37000 }, { "epoch": 331.7417218543046, "grad_norm": 0.8844119906425476, "learning_rate": 1.25e-05, "loss": 0.0857, "step": 37500 }, { "epoch": 336.12362030905075, "grad_norm": 0.89303058385849, "learning_rate": 1.2e-05, "loss": 0.0836, "step": 38000 }, { "epoch": 340.5121412803532, "grad_norm": 0.897951602935791, "learning_rate": 1.1500000000000002e-05, "loss": 0.0819, "step": 38500 } ], "logging_steps": 500, "max_steps": 50000, "num_input_tokens_seen": 0, "num_train_epochs": 443, "save_steps": 20, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.2153029705728e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }