nero-ysss/checkpoint-38800/trainer_state.json
2025-03-26 10:17:03 +02:00

572 lines
13 KiB
JSON

{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 343.3620309050773,
"eval_steps": 500,
"global_step": 38800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 4.406181015452539,
"grad_norm": 0.8222458958625793,
"learning_rate": 4.9500000000000004e-05,
"loss": 3.9899,
"step": 500
},
{
"epoch": 8.794701986754967,
"grad_norm": 0.9474080204963684,
"learning_rate": 4.9e-05,
"loss": 3.7024,
"step": 1000
},
{
"epoch": 13.176600441501105,
"grad_norm": 1.0692858695983887,
"learning_rate": 4.85e-05,
"loss": 3.4284,
"step": 1500
},
{
"epoch": 17.56512141280353,
"grad_norm": 1.097322940826416,
"learning_rate": 4.8e-05,
"loss": 3.1904,
"step": 2000
},
{
"epoch": 21.95364238410596,
"grad_norm": 1.2007817029953003,
"learning_rate": 4.75e-05,
"loss": 2.9764,
"step": 2500
},
{
"epoch": 26.335540838852097,
"grad_norm": 1.2675273418426514,
"learning_rate": 4.7e-05,
"loss": 2.7812,
"step": 3000
},
{
"epoch": 30.724061810154524,
"grad_norm": 1.2794780731201172,
"learning_rate": 4.6500000000000005e-05,
"loss": 2.6072,
"step": 3500
},
{
"epoch": 35.38852097130243,
"grad_norm": 1.3926743268966675,
"learning_rate": 4.600000000000001e-05,
"loss": 2.4002,
"step": 4000
},
{
"epoch": 39.77704194260485,
"grad_norm": 1.3976378440856934,
"learning_rate": 4.55e-05,
"loss": 2.2963,
"step": 4500
},
{
"epoch": 44.158940397350996,
"grad_norm": 1.4675860404968262,
"learning_rate": 4.5e-05,
"loss": 2.1558,
"step": 5000
},
{
"epoch": 48.54746136865342,
"grad_norm": 1.4536672830581665,
"learning_rate": 4.4500000000000004e-05,
"loss": 2.0227,
"step": 5500
},
{
"epoch": 52.93598233995585,
"grad_norm": 1.4907385110855103,
"learning_rate": 4.4000000000000006e-05,
"loss": 1.9043,
"step": 6000
},
{
"epoch": 57.317880794701985,
"grad_norm": 1.5043652057647705,
"learning_rate": 4.35e-05,
"loss": 1.7846,
"step": 6500
},
{
"epoch": 61.70640176600442,
"grad_norm": 1.5272749662399292,
"learning_rate": 4.3e-05,
"loss": 1.6737,
"step": 7000
},
{
"epoch": 66.08830022075055,
"grad_norm": 1.5962594747543335,
"learning_rate": 4.25e-05,
"loss": 1.5731,
"step": 7500
},
{
"epoch": 70.47682119205298,
"grad_norm": 1.5520045757293701,
"learning_rate": 4.2e-05,
"loss": 1.4763,
"step": 8000
},
{
"epoch": 74.86534216335541,
"grad_norm": 1.5050873756408691,
"learning_rate": 4.15e-05,
"loss": 1.3849,
"step": 8500
},
{
"epoch": 79.24724061810154,
"grad_norm": 1.593792200088501,
"learning_rate": 4.1e-05,
"loss": 1.297,
"step": 9000
},
{
"epoch": 83.63576158940397,
"grad_norm": 1.6733592748641968,
"learning_rate": 4.05e-05,
"loss": 1.2148,
"step": 9500
},
{
"epoch": 88.0176600441501,
"grad_norm": 1.5692708492279053,
"learning_rate": 4e-05,
"loss": 1.139,
"step": 10000
},
{
"epoch": 92.40618101545253,
"grad_norm": 1.6074855327606201,
"learning_rate": 3.9500000000000005e-05,
"loss": 1.062,
"step": 10500
},
{
"epoch": 96.79470198675497,
"grad_norm": 1.6174248456954956,
"learning_rate": 3.9000000000000006e-05,
"loss": 0.9947,
"step": 11000
},
{
"epoch": 101.17660044150111,
"grad_norm": 1.6355832815170288,
"learning_rate": 3.85e-05,
"loss": 0.9289,
"step": 11500
},
{
"epoch": 105.56512141280353,
"grad_norm": 1.5573843717575073,
"learning_rate": 3.8e-05,
"loss": 0.8648,
"step": 12000
},
{
"epoch": 109.95364238410596,
"grad_norm": 1.6609675884246826,
"learning_rate": 3.7500000000000003e-05,
"loss": 0.8105,
"step": 12500
},
{
"epoch": 114.3355408388521,
"grad_norm": 1.5728868246078491,
"learning_rate": 3.7e-05,
"loss": 0.7535,
"step": 13000
},
{
"epoch": 118.72406181015452,
"grad_norm": 1.6245304346084595,
"learning_rate": 3.65e-05,
"loss": 0.7034,
"step": 13500
},
{
"epoch": 123.10596026490066,
"grad_norm": 1.593719482421875,
"learning_rate": 3.6e-05,
"loss": 0.6554,
"step": 14000
},
{
"epoch": 127.49448123620309,
"grad_norm": 1.6109435558319092,
"learning_rate": 3.55e-05,
"loss": 0.6112,
"step": 14500
},
{
"epoch": 131.8830022075055,
"grad_norm": 1.6921696662902832,
"learning_rate": 3.5e-05,
"loss": 0.5707,
"step": 15000
},
{
"epoch": 136.26490066225165,
"grad_norm": 1.6247228384017944,
"learning_rate": 3.45e-05,
"loss": 0.5321,
"step": 15500
},
{
"epoch": 140.65342163355407,
"grad_norm": 1.6326526403427124,
"learning_rate": 3.4000000000000007e-05,
"loss": 0.4967,
"step": 16000
},
{
"epoch": 145.0353200883002,
"grad_norm": 1.4845603704452515,
"learning_rate": 3.35e-05,
"loss": 0.4649,
"step": 16500
},
{
"epoch": 149.42384105960264,
"grad_norm": 1.5263372659683228,
"learning_rate": 3.3e-05,
"loss": 0.4334,
"step": 17000
},
{
"epoch": 153.81236203090506,
"grad_norm": 1.411693811416626,
"learning_rate": 3.2500000000000004e-05,
"loss": 0.407,
"step": 17500
},
{
"epoch": 158.19426048565123,
"grad_norm": 1.459270715713501,
"learning_rate": 3.2000000000000005e-05,
"loss": 0.3815,
"step": 18000
},
{
"epoch": 162.58278145695365,
"grad_norm": 1.5529966354370117,
"learning_rate": 3.15e-05,
"loss": 0.3581,
"step": 18500
},
{
"epoch": 166.97130242825608,
"grad_norm": 1.432273268699646,
"learning_rate": 3.1e-05,
"loss": 0.3373,
"step": 19000
},
{
"epoch": 171.35320088300222,
"grad_norm": 1.3730608224868774,
"learning_rate": 3.05e-05,
"loss": 0.3169,
"step": 19500
},
{
"epoch": 175.74172185430464,
"grad_norm": 1.4327744245529175,
"learning_rate": 3e-05,
"loss": 0.2998,
"step": 20000
},
{
"epoch": 180.12362030905078,
"grad_norm": 1.3872003555297852,
"learning_rate": 2.95e-05,
"loss": 0.2831,
"step": 20500
},
{
"epoch": 184.5121412803532,
"grad_norm": 1.3601843118667603,
"learning_rate": 2.9e-05,
"loss": 0.2674,
"step": 21000
},
{
"epoch": 188.90066225165563,
"grad_norm": 1.278759241104126,
"learning_rate": 2.8499999999999998e-05,
"loss": 0.2546,
"step": 21500
},
{
"epoch": 193.28256070640177,
"grad_norm": 1.3242909908294678,
"learning_rate": 2.8000000000000003e-05,
"loss": 0.2415,
"step": 22000
},
{
"epoch": 197.6710816777042,
"grad_norm": 1.29855477809906,
"learning_rate": 2.7500000000000004e-05,
"loss": 0.2295,
"step": 22500
},
{
"epoch": 202.05298013245033,
"grad_norm": 1.1802529096603394,
"learning_rate": 2.7000000000000002e-05,
"loss": 0.2193,
"step": 23000
},
{
"epoch": 206.44150110375276,
"grad_norm": 1.230195164680481,
"learning_rate": 2.6500000000000004e-05,
"loss": 0.2084,
"step": 23500
},
{
"epoch": 212.37969094922738,
"grad_norm": 1.2718374729156494,
"learning_rate": 2.6000000000000002e-05,
"loss": 0.1966,
"step": 24000
},
{
"epoch": 216.7682119205298,
"grad_norm": 1.2735928297042847,
"learning_rate": 2.5500000000000003e-05,
"loss": 0.1911,
"step": 24500
},
{
"epoch": 221.15011037527594,
"grad_norm": 1.1786949634552002,
"learning_rate": 2.5e-05,
"loss": 0.1832,
"step": 25000
},
{
"epoch": 225.53863134657837,
"grad_norm": 1.1616557836532593,
"learning_rate": 2.45e-05,
"loss": 0.1751,
"step": 25500
},
{
"epoch": 229.9271523178808,
"grad_norm": 1.1504043340682983,
"learning_rate": 2.4e-05,
"loss": 0.1688,
"step": 26000
},
{
"epoch": 234.48565121412804,
"grad_norm": 1.1552656888961792,
"learning_rate": 2.35e-05,
"loss": 0.1618,
"step": 26500
},
{
"epoch": 238.87417218543047,
"grad_norm": 1.1210813522338867,
"learning_rate": 2.3000000000000003e-05,
"loss": 0.1561,
"step": 27000
},
{
"epoch": 243.2560706401766,
"grad_norm": 1.1037412881851196,
"learning_rate": 2.25e-05,
"loss": 0.1502,
"step": 27500
},
{
"epoch": 247.64459161147903,
"grad_norm": 1.0126384496688843,
"learning_rate": 2.2000000000000003e-05,
"loss": 0.1448,
"step": 28000
},
{
"epoch": 252.19426048565123,
"grad_norm": 1.0003942251205444,
"learning_rate": 2.15e-05,
"loss": 0.1394,
"step": 28500
},
{
"epoch": 256.5827814569536,
"grad_norm": 1.0045232772827148,
"learning_rate": 2.1e-05,
"loss": 0.1352,
"step": 29000
},
{
"epoch": 260.9713024282561,
"grad_norm": 1.046236515045166,
"learning_rate": 2.05e-05,
"loss": 0.1314,
"step": 29500
},
{
"epoch": 265.48565121412804,
"grad_norm": 0.9956527352333069,
"learning_rate": 2e-05,
"loss": 0.1257,
"step": 30000
},
{
"epoch": 269.87417218543044,
"grad_norm": 1.0047001838684082,
"learning_rate": 1.9500000000000003e-05,
"loss": 0.1229,
"step": 30500
},
{
"epoch": 274.3355408388521,
"grad_norm": 0.9991653561592102,
"learning_rate": 1.9e-05,
"loss": 0.1184,
"step": 31000
},
{
"epoch": 278.7240618101545,
"grad_norm": 0.958787202835083,
"learning_rate": 1.85e-05,
"loss": 0.1155,
"step": 31500
},
{
"epoch": 283.10596026490066,
"grad_norm": 0.9622847437858582,
"learning_rate": 1.8e-05,
"loss": 0.1121,
"step": 32000
},
{
"epoch": 287.4944812362031,
"grad_norm": 0.9591727256774902,
"learning_rate": 1.75e-05,
"loss": 0.1093,
"step": 32500
},
{
"epoch": 291.8830022075055,
"grad_norm": 1.010334849357605,
"learning_rate": 1.7000000000000003e-05,
"loss": 0.1061,
"step": 33000
},
{
"epoch": 296.26490066225165,
"grad_norm": 0.974038302898407,
"learning_rate": 1.65e-05,
"loss": 0.1031,
"step": 33500
},
{
"epoch": 300.6534216335541,
"grad_norm": 0.9348180890083313,
"learning_rate": 1.6000000000000003e-05,
"loss": 0.1007,
"step": 34000
},
{
"epoch": 305.03532008830024,
"grad_norm": 0.9226692318916321,
"learning_rate": 1.55e-05,
"loss": 0.0983,
"step": 34500
},
{
"epoch": 309.42384105960264,
"grad_norm": 0.9339843988418579,
"learning_rate": 1.5e-05,
"loss": 0.0957,
"step": 35000
},
{
"epoch": 313.8123620309051,
"grad_norm": 0.9748533368110657,
"learning_rate": 1.45e-05,
"loss": 0.0934,
"step": 35500
},
{
"epoch": 318.5827814569536,
"grad_norm": 0.8408458828926086,
"learning_rate": 1.4000000000000001e-05,
"loss": 0.0903,
"step": 36000
},
{
"epoch": 322.9713024282561,
"grad_norm": 0.9094577431678772,
"learning_rate": 1.3500000000000001e-05,
"loss": 0.0893,
"step": 36500
},
{
"epoch": 327.3532008830022,
"grad_norm": 0.9151813387870789,
"learning_rate": 1.3000000000000001e-05,
"loss": 0.0875,
"step": 37000
},
{
"epoch": 331.7417218543046,
"grad_norm": 0.8844119906425476,
"learning_rate": 1.25e-05,
"loss": 0.0857,
"step": 37500
},
{
"epoch": 336.12362030905075,
"grad_norm": 0.89303058385849,
"learning_rate": 1.2e-05,
"loss": 0.0836,
"step": 38000
},
{
"epoch": 340.5121412803532,
"grad_norm": 0.897951602935791,
"learning_rate": 1.1500000000000002e-05,
"loss": 0.0819,
"step": 38500
}
],
"logging_steps": 500,
"max_steps": 50000,
"num_input_tokens_seen": 0,
"num_train_epochs": 443,
"save_steps": 20,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.22033022926848e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}