kubernetes-bad commited on 22 days ago

Commit

e89c5d5

•

1 Parent(s): 4a869b4

Upload folder using huggingface_hub

Browse files

Files changed (19) hide show

config.json +26 -0
generation_config.json +7 -0
model-00001-of-00009.safetensors +3 -0
model-00002-of-00009.safetensors +3 -0
model-00003-of-00009.safetensors +3 -0
model-00004-of-00009.safetensors +3 -0
model-00005-of-00009.safetensors +3 -0
model-00006-of-00009.safetensors +3 -0
model-00007-of-00009.safetensors +3 -0
model-00008-of-00009.safetensors +3 -0
model-00009-of-00009.safetensors +3 -0
model.safetensors.index.json +514 -0
prompts.txt +20 -0
special_tokens_map.json +30 -0
tokenizer.json +0 -0
tokenizer.model +3 -0
tokenizer_config.json +0 -0
trainer_state.json +719 -0
training_args.bin +3 -0

config.json ADDED Viewed

	@@ -0,0 +1,26 @@

+{
+  "architectures": [
+    "MistralForCausalLM"
+  ],
+  "attention_dropout": 0.0,
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "head_dim": 128,
+  "hidden_act": "silu",
+  "hidden_size": 6144,
+  "initializer_range": 0.02,
+  "intermediate_size": 16384,
+  "max_position_embeddings": 32768,
+  "model_type": "mistral",
+  "num_attention_heads": 48,
+  "num_hidden_layers": 56,
+  "num_key_value_heads": 8,
+  "rms_norm_eps": 1e-05,
+  "rope_theta": 1000000.0,
+  "sliding_window": null,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.46.0",
+  "use_cache": false,
+  "vocab_size": 32768
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,7 @@

+{
+  "_from_model_config": true,
+  "bos_token_id": 1,
+  "do_sample": true,
+  "eos_token_id": 2,
+  "transformers_version": "4.46.0"
+}

model-00001-of-00009.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:391b3e505fbb6518e6d415a9540cb7bdfe40ef31f6e8c2b760c5c2d84d27af24
+size 4882298776

model-00002-of-00009.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5ed8eff4aaa4f7bf2a73af889667d9ddb03fb0d5d105a40ebc9d05fbafd6cb15
+size 4983012160

model-00003-of-00009.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:200c8574d8328336b5b11725f32f6453b025737bc3c105cbaf09b7dd701e0a32
+size 4957821336

model-00004-of-00009.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:7c05b2d9bab255af90d59ee886c60ec1da7b19532c70edd09b9d6ebcf4b1df58
+size 4882323744

model-00005-of-00009.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:799cec1cf7be2c4d04aec87abbddd6965887496e9d61211fcf6ae663b57936e6
+size 4983012192

model-00006-of-00009.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c54613e38485dc2180864e19328dfb146e40b3da3d46da6391d7dc29cd88bb2e
+size 4957821336

model-00007-of-00009.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:7da5f5bc16355b86e71b7d553f7458c8e7747f96c7ee90e167b3412174c7861c
+size 4882323744

model-00008-of-00009.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0d8184ebd62bde743e990b75311f89a569a254c966005e50d916fc934ab28944
+size 4983012192

model-00009-of-00009.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:ce067f484f8d94833420319d1159f21cbf69d38c088ca4d507176a3640584651
+size 4982999056

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,514 @@

+{
+  "metadata": {
+    "total_size": 44494565376
+  },
+  "weight_map": {
+    "lm_head.weight": "model-00009-of-00009.safetensors",
+    "model.embed_tokens.weight": "model-00001-of-00009.safetensors",
+    "model.layers.0.input_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.0.mlp.down_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.0.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.1.input_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.1.mlp.down_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.1.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.10.input_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.10.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.10.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.11.input_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.11.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.11.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.12.input_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.12.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.12.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.12.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.12.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.12.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.13.input_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.13.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.13.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.13.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.13.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.13.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.13.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.13.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.13.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.14.input_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.14.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.14.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.14.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.14.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.14.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.14.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.14.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.14.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.15.input_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.15.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.15.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.15.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.15.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.15.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.15.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.15.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.15.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.16.input_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.16.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.16.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.16.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.16.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.16.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.16.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.16.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.16.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.17.input_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.17.mlp.down_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.17.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.17.mlp.up_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.17.post_attention_layernorm.weight": "model-00003-of-00009.safetensors",
+    "model.layers.17.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.17.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.17.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.17.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.18.input_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.18.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.18.mlp.gate_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.18.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.18.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.18.self_attn.k_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.18.self_attn.o_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.18.self_attn.q_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.18.self_attn.v_proj.weight": "model-00003-of-00009.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.2.input_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.2.mlp.down_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.2.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.20.input_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.20.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.20.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.20.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.21.input_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.21.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.21.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.21.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.21.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.21.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.21.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.21.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.21.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.22.input_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.22.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.22.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.22.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.22.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.22.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.22.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.22.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.22.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.23.input_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.23.mlp.down_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.23.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.23.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.23.post_attention_layernorm.weight": "model-00004-of-00009.safetensors",
+    "model.layers.23.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.23.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.23.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.23.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.24.input_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.24.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.24.mlp.gate_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.24.mlp.up_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.24.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.24.self_attn.k_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.24.self_attn.o_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.24.self_attn.q_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.24.self_attn.v_proj.weight": "model-00004-of-00009.safetensors",
+    "model.layers.25.input_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.25.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.25.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.25.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.25.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.25.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.25.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.25.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.25.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.26.input_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.26.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.26.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.26.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.26.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.26.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.26.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.26.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.26.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.27.input_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.27.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.27.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.27.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.27.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.27.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.27.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.27.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.27.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.28.input_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.28.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.28.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.28.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.28.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.28.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.28.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.28.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.28.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.29.input_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.29.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.29.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.29.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.29.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.29.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.29.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.29.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.29.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.3.input_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.3.mlp.down_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.3.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.30.input_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.30.mlp.down_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.30.mlp.gate_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.30.mlp.up_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.30.post_attention_layernorm.weight": "model-00005-of-00009.safetensors",
+    "model.layers.30.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.30.self_attn.o_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.30.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.30.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.31.input_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.31.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.31.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.31.self_attn.k_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.31.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.31.self_attn.q_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.31.self_attn.v_proj.weight": "model-00005-of-00009.safetensors",
+    "model.layers.32.input_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.32.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.32.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.32.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.32.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.32.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.32.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.32.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.32.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.33.input_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.33.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.33.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.33.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.33.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.33.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.33.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.33.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.33.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.34.input_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.34.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.34.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.34.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.34.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.34.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.34.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.34.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.34.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.35.input_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.35.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.35.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.35.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.35.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.35.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.35.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.35.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.35.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.36.input_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.36.mlp.down_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.36.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.36.mlp.up_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.36.post_attention_layernorm.weight": "model-00006-of-00009.safetensors",
+    "model.layers.36.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.36.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.36.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.36.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.37.input_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.37.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.37.mlp.gate_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.37.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.37.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.37.self_attn.k_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.37.self_attn.o_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.37.self_attn.q_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.37.self_attn.v_proj.weight": "model-00006-of-00009.safetensors",
+    "model.layers.38.input_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.38.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.38.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.38.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.38.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.38.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.38.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.38.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.38.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.39.input_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.39.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.39.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.39.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.39.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.39.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.39.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.39.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.39.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.4.input_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.4.mlp.down_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.4.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00009.safetensors",
+    "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.40.input_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.40.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.40.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.40.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.40.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.40.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.40.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.40.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.40.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.41.input_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.41.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.41.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.41.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.41.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.41.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.41.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.41.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.41.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.42.input_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.42.mlp.down_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.42.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.42.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.42.post_attention_layernorm.weight": "model-00007-of-00009.safetensors",
+    "model.layers.42.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.42.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.42.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.42.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.43.input_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.43.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.43.mlp.gate_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.43.mlp.up_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.43.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.43.self_attn.k_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.43.self_attn.o_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.43.self_attn.q_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.43.self_attn.v_proj.weight": "model-00007-of-00009.safetensors",
+    "model.layers.44.input_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.44.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.44.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.44.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.44.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.44.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.44.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.44.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.44.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.45.input_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.45.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.45.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.45.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.45.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.45.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.45.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.45.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.45.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.46.input_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.46.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.46.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.46.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.46.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.46.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.46.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.46.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.46.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.47.input_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.47.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.47.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.47.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.47.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.47.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.47.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.47.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.47.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.48.input_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.48.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.48.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.48.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.48.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.48.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.48.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.48.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.48.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.49.input_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.49.mlp.down_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.49.mlp.gate_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.49.mlp.up_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.49.post_attention_layernorm.weight": "model-00008-of-00009.safetensors",
+    "model.layers.49.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.49.self_attn.o_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.49.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.49.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.5.input_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.5.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.5.mlp.up_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.5.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00009.safetensors",
+    "model.layers.50.input_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.50.mlp.down_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.50.mlp.gate_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.50.mlp.up_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.50.post_attention_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.50.self_attn.k_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.50.self_attn.o_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.50.self_attn.q_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.50.self_attn.v_proj.weight": "model-00008-of-00009.safetensors",
+    "model.layers.51.input_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.51.mlp.down_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.51.mlp.gate_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.51.mlp.up_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.51.post_attention_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.51.self_attn.k_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.51.self_attn.o_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.51.self_attn.q_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.51.self_attn.v_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.52.input_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.52.mlp.down_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.52.mlp.gate_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.52.mlp.up_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.52.post_attention_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.52.self_attn.k_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.52.self_attn.o_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.52.self_attn.q_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.52.self_attn.v_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.53.input_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.53.mlp.down_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.53.mlp.gate_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.53.mlp.up_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.53.post_attention_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.53.self_attn.k_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.53.self_attn.o_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.53.self_attn.q_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.53.self_attn.v_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.54.input_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.54.mlp.down_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.54.mlp.gate_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.54.mlp.up_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.54.post_attention_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.54.self_attn.k_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.54.self_attn.o_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.54.self_attn.q_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.54.self_attn.v_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.55.input_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.55.mlp.down_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.55.mlp.gate_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.55.mlp.up_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.55.post_attention_layernorm.weight": "model-00009-of-00009.safetensors",
+    "model.layers.55.self_attn.k_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.55.self_attn.o_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.55.self_attn.q_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.55.self_attn.v_proj.weight": "model-00009-of-00009.safetensors",
+    "model.layers.6.input_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.6.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.6.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.6.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.7.input_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.7.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.7.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.7.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.7.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.7.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.7.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.8.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.8.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.8.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.8.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.8.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.9.input_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.9.mlp.down_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.9.mlp.up_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00009.safetensors",
+    "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00009.safetensors",
+    "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00009.safetensors",
+    "model.norm.weight": "model-00009-of-00009.safetensors"
+  }
+}

prompts.txt ADDED Viewed

	@@ -0,0 +1,20 @@

+Mistral v2v3 template
+Base model has no system message, so we prepend it to first User turn. Below is an example:
+<s>[INST] You are an expert in creating interesting roleplay characters. Your main goal is to create a vibrant persona for roleplay. Use on-point simple language, avoiding overly complex phrases. It is acceptable to assume or even create missing details about the character. Refer to roleplaying user as User.
+---
+Below is a brief overview of a character. Expand it into a detailed description. Include details about character's personality, their outfit and figure. Mention their age and gender, if applicable.
+---
+{char prompt}
+---
+Use third person narration. Start your response with "{name} is ..."[/INST]
+Here are some other raw prompts from the Web App:
+```
+const PROMPT_SCENARIO = "Write an interesting and engaging scenario for roleplay between {{char}} and {{user}}.";
+const PROMPT_PERSONALITY = "Write several personal qualities that characterize {{char}}.";
+const PROMPT_FIRST_MESSAGE = "Write the initial message in this roleplay that would introduce {{user}} to {{char}} and the scenario.";
+const PROMPT_EXAMPLE_DIALOGS  = "Write a few example exchanges between {{user}} and {{char}} in chat format. Separate each exchange with a <START> tag.";
+const PROMPT_APPEARANCE = 'Imagine what {{char}} could look like and describe {{char}}\'s portrait. Capture their appearance, clothes and body features, as well as the background setting they can be in. Only include details that would be useful when describing their photo. Omit explanation or any personality traits that cannot be reflected graphically, and focus on visual characteristics instead. Your task is to give specific instructions on how to draw {{char}}\'s portrait. Start your response with "{{char}} is ...".';
+```

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,30 @@

+{
+  "bos_token": {
+    "content": "<s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "</s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "</s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer.model ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:59f95e28944c062244741268596badc900df86c7f5ded05088d2da22a7379e06
+size 587583

tokenizer_config.json ADDED Viewed

The diff for this file is too large to render. See raw diff

trainer_state.json ADDED Viewed

	@@ -0,0 +1,719 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 2.0,
+  "eval_steps": 500,
+  "global_step": 98,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.02040816326530612,
+      "grad_norm": 32.64888547751775,
+      "learning_rate": 4e-07,
+      "loss": 1.7523,
+      "step": 1
+    },
+    {
+      "epoch": 0.04081632653061224,
+      "grad_norm": 29.727934420700674,
+      "learning_rate": 8e-07,
+      "loss": 1.7913,
+      "step": 2
+    },
+    {
+      "epoch": 0.061224489795918366,
+      "grad_norm": 24.405865809933943,
+      "learning_rate": 1.2e-06,
+      "loss": 1.7695,
+      "step": 3
+    },
+    {
+      "epoch": 0.08163265306122448,
+      "grad_norm": 10.393646720510844,
+      "learning_rate": 1.6e-06,
+      "loss": 1.7459,
+      "step": 4
+    },
+    {
+      "epoch": 0.10204081632653061,
+      "grad_norm": 8.901802813033639,
+      "learning_rate": 2e-06,
+      "loss": 1.6905,
+      "step": 5
+    },
+    {
+      "epoch": 0.12244897959183673,
+      "grad_norm": 6.824537248098065,
+      "learning_rate": 2.4e-06,
+      "loss": 1.6515,
+      "step": 6
+    },
+    {
+      "epoch": 0.14285714285714285,
+      "grad_norm": 7.83712617181299,
+      "learning_rate": 2.8e-06,
+      "loss": 1.6029,
+      "step": 7
+    },
+    {
+      "epoch": 0.16326530612244897,
+      "grad_norm": 6.032348523836469,
+      "learning_rate": 3.2e-06,
+      "loss": 1.6653,
+      "step": 8
+    },
+    {
+      "epoch": 0.1836734693877551,
+      "grad_norm": 6.362729786136031,
+      "learning_rate": 3.6e-06,
+      "loss": 1.6055,
+      "step": 9
+    },
+    {
+      "epoch": 0.20408163265306123,
+      "grad_norm": 5.363581180186887,
+      "learning_rate": 4e-06,
+      "loss": 1.626,
+      "step": 10
+    },
+    {
+      "epoch": 0.22448979591836735,
+      "grad_norm": 5.614245135697976,
+      "learning_rate": 3.99971472511942e-06,
+      "loss": 1.6121,
+      "step": 11
+    },
+    {
+      "epoch": 0.24489795918367346,
+      "grad_norm": 5.004151493115574,
+      "learning_rate": 3.998858981859435e-06,
+      "loss": 1.6153,
+      "step": 12
+    },
+    {
+      "epoch": 0.2653061224489796,
+      "grad_norm": 5.286918190889841,
+      "learning_rate": 3.997433014342105e-06,
+      "loss": 1.5694,
+      "step": 13
+    },
+    {
+      "epoch": 0.2857142857142857,
+      "grad_norm": 4.875583241251316,
+      "learning_rate": 3.995437229360142e-06,
+      "loss": 1.6542,
+      "step": 14
+    },
+    {
+      "epoch": 0.30612244897959184,
+      "grad_norm": 6.001720206242898,
+      "learning_rate": 3.992872196260866e-06,
+      "loss": 1.5836,
+      "step": 15
+    },
+    {
+      "epoch": 0.32653061224489793,
+      "grad_norm": 5.523386731381072,
+      "learning_rate": 3.98973864678379e-06,
+      "loss": 1.6299,
+      "step": 16
+    },
+    {
+      "epoch": 0.3469387755102041,
+      "grad_norm": 9.219665630268889,
+      "learning_rate": 3.986037474851867e-06,
+      "loss": 1.6475,
+      "step": 17
+    },
+    {
+      "epoch": 0.3673469387755102,
+      "grad_norm": 4.709359040696749,
+      "learning_rate": 3.981769736316478e-06,
+      "loss": 1.6115,
+      "step": 18
+    },
+    {
+      "epoch": 0.3877551020408163,
+      "grad_norm": 4.977891858877406,
+      "learning_rate": 3.976936648656223e-06,
+      "loss": 1.5892,
+      "step": 19
+    },
+    {
+      "epoch": 0.40816326530612246,
+      "grad_norm": 4.825081766216579,
+      "learning_rate": 3.971539590629607e-06,
+      "loss": 1.6161,
+      "step": 20
+    },
+    {
+      "epoch": 0.42857142857142855,
+      "grad_norm": 4.521060581667052,
+      "learning_rate": 3.965580101881716e-06,
+      "loss": 1.5968,
+      "step": 21
+    },
+    {
+      "epoch": 0.4489795918367347,
+      "grad_norm": 5.559962293768277,
+      "learning_rate": 3.959059882504989e-06,
+      "loss": 1.574,
+      "step": 22
+    },
+    {
+      "epoch": 0.46938775510204084,
+      "grad_norm": 22.09612765494523,
+      "learning_rate": 3.951980792554231e-06,
+      "loss": 1.5748,
+      "step": 23
+    },
+    {
+      "epoch": 0.4897959183673469,
+      "grad_norm": 5.40962977240307,
+      "learning_rate": 3.944344851515981e-06,
+      "loss": 1.6046,
+      "step": 24
+    },
+    {
+      "epoch": 0.5102040816326531,
+      "grad_norm": 5.1355184641109455,
+      "learning_rate": 3.936154237732409e-06,
+      "loss": 1.621,
+      "step": 25
+    },
+    {
+      "epoch": 0.5306122448979592,
+      "grad_norm": 6.8504360271944575,
+      "learning_rate": 3.927411287779882e-06,
+      "loss": 1.6124,
+      "step": 26
+    },
+    {
+      "epoch": 0.5510204081632653,
+      "grad_norm": 4.482668388299841,
+      "learning_rate": 3.918118495802404e-06,
+      "loss": 1.5747,
+      "step": 27
+    },
+    {
+      "epoch": 0.5714285714285714,
+      "grad_norm": 5.239757336297107,
+      "learning_rate": 3.9082785128000975e-06,
+      "loss": 1.5625,
+      "step": 28
+    },
+    {
+      "epoch": 0.5918367346938775,
+      "grad_norm": 4.5776640976135585,
+      "learning_rate": 3.8978941458729376e-06,
+      "loss": 1.6,
+      "step": 29
+    },
+    {
+      "epoch": 0.6122448979591837,
+      "grad_norm": 4.55153687355674,
+      "learning_rate": 3.88696835741996e-06,
+      "loss": 1.6203,
+      "step": 30
+    },
+    {
+      "epoch": 0.6326530612244898,
+      "grad_norm": 4.489870280563155,
+      "learning_rate": 3.875504264294161e-06,
+      "loss": 1.6375,
+      "step": 31
+    },
+    {
+      "epoch": 0.6530612244897959,
+      "grad_norm": 5.310641662353565,
+      "learning_rate": 3.8635051369133365e-06,
+      "loss": 1.5707,
+      "step": 32
+    },
+    {
+      "epoch": 0.673469387755102,
+      "grad_norm": 6.202748915782672,
+      "learning_rate": 3.850974398327119e-06,
+      "loss": 1.564,
+      "step": 33
+    },
+    {
+      "epoch": 0.6938775510204082,
+      "grad_norm": 7.749515519920348,
+      "learning_rate": 3.837915623240461e-06,
+      "loss": 1.5765,
+      "step": 34
+    },
+    {
+      "epoch": 0.7142857142857143,
+      "grad_norm": 5.415603692442806,
+      "learning_rate": 3.824332536993866e-06,
+      "loss": 1.5994,
+      "step": 35
+    },
+    {
+      "epoch": 0.7346938775510204,
+      "grad_norm": 5.480596530632035,
+      "learning_rate": 3.810229014500642e-06,
+      "loss": 1.5561,
+      "step": 36
+    },
+    {
+      "epoch": 0.7551020408163265,
+      "grad_norm": 4.233153242655977,
+      "learning_rate": 3.795609079141483e-06,
+      "loss": 1.5983,
+      "step": 37
+    },
+    {
+      "epoch": 0.7755102040816326,
+      "grad_norm": 4.178343085078006,
+      "learning_rate": 3.780476901616703e-06,
+      "loss": 1.6171,
+      "step": 38
+    },
+    {
+      "epoch": 0.7959183673469388,
+      "grad_norm": 4.4176408442610455,
+      "learning_rate": 3.764836798756438e-06,
+      "loss": 1.5727,
+      "step": 39
+    },
+    {
+      "epoch": 0.8163265306122449,
+      "grad_norm": 4.318784572510763,
+      "learning_rate": 3.748693232289164e-06,
+      "loss": 1.6577,
+      "step": 40
+    },
+    {
+      "epoch": 0.8367346938775511,
+      "grad_norm": 4.683545812852939,
+      "learning_rate": 3.7320508075688773e-06,
+      "loss": 1.5839,
+      "step": 41
+    },
+    {
+      "epoch": 0.8571428571428571,
+      "grad_norm": 4.2416142714136225,
+      "learning_rate": 3.7149142722613015e-06,
+      "loss": 1.5326,
+      "step": 42
+    },
+    {
+      "epoch": 0.8775510204081632,
+      "grad_norm": 5.8485689528715845,
+      "learning_rate": 3.697288514989502e-06,
+      "loss": 1.5531,
+      "step": 43
+    },
+    {
+      "epoch": 0.8979591836734694,
+      "grad_norm": 4.264324101534887,
+      "learning_rate": 3.6791785639392775e-06,
+      "loss": 1.6034,
+      "step": 44
+    },
+    {
+      "epoch": 0.9183673469387755,
+      "grad_norm": 4.066575551440298,
+      "learning_rate": 3.6605895854247527e-06,
+      "loss": 1.5921,
+      "step": 45
+    },
+    {
+      "epoch": 0.9387755102040817,
+      "grad_norm": 4.034643806151124,
+      "learning_rate": 3.641526882414553e-06,
+      "loss": 1.5434,
+      "step": 46
+    },
+    {
+      "epoch": 0.9591836734693877,
+      "grad_norm": 4.132555724507058,
+      "learning_rate": 3.6219958930190024e-06,
+      "loss": 1.5853,
+      "step": 47
+    },
+    {
+      "epoch": 0.9795918367346939,
+      "grad_norm": 4.153531674893339,
+      "learning_rate": 3.602002188938769e-06,
+      "loss": 1.5858,
+      "step": 48
+    },
+    {
+      "epoch": 1.0,
+      "grad_norm": 4.146826988211348,
+      "learning_rate": 3.581551473875397e-06,
+      "loss": 1.5848,
+      "step": 49
+    },
+    {
+      "epoch": 1.0204081632653061,
+      "grad_norm": 8.656902757205804,
+      "learning_rate": 3.5606495819041836e-06,
+      "loss": 1.1151,
+      "step": 50
+    },
+    {
+      "epoch": 1.0408163265306123,
+      "grad_norm": 5.988124543792571,
+      "learning_rate": 3.539302475809864e-06,
+      "loss": 1.0798,
+      "step": 51
+    },
+    {
+      "epoch": 1.0612244897959184,
+      "grad_norm": 8.934677443634214,
+      "learning_rate": 3.5175162453855814e-06,
+      "loss": 1.043,
+      "step": 52
+    },
+    {
+      "epoch": 1.0816326530612246,
+      "grad_norm": 6.588611053883156,
+      "learning_rate": 3.4952971056956184e-06,
+      "loss": 1.0923,
+      "step": 53
+    },
+    {
+      "epoch": 1.1020408163265305,
+      "grad_norm": 5.749985643136262,
+      "learning_rate": 3.4726513953023944e-06,
+      "loss": 1.088,
+      "step": 54
+    },
+    {
+      "epoch": 1.1224489795918366,
+      "grad_norm": 5.539993882620073,
+      "learning_rate": 3.4495855744582397e-06,
+      "loss": 1.0816,
+      "step": 55
+    },
+    {
+      "epoch": 1.1428571428571428,
+      "grad_norm": 6.90795649908795,
+      "learning_rate": 3.4261062232624404e-06,
+      "loss": 0.9693,
+      "step": 56
+    },
+    {
+      "epoch": 1.163265306122449,
+      "grad_norm": 5.478500360298918,
+      "learning_rate": 3.4022200397841054e-06,
+      "loss": 1.015,
+      "step": 57
+    },
+    {
+      "epoch": 1.183673469387755,
+      "grad_norm": 6.342399558155308,
+      "learning_rate": 3.3779338381513733e-06,
+      "loss": 0.992,
+      "step": 58
+    },
+    {
+      "epoch": 1.2040816326530612,
+      "grad_norm": 5.701765352521379,
+      "learning_rate": 3.3532545466075147e-06,
+      "loss": 0.9691,
+      "step": 59
+    },
+    {
+      "epoch": 1.2244897959183674,
+      "grad_norm": 5.5584312567296035,
+      "learning_rate": 3.328189205534478e-06,
+      "loss": 0.9681,
+      "step": 60
+    },
+    {
+      "epoch": 1.2448979591836735,
+      "grad_norm": 7.038510873972207,
+      "learning_rate": 3.3027449654444447e-06,
+      "loss": 0.9677,
+      "step": 61
+    },
+    {
+      "epoch": 1.2653061224489797,
+      "grad_norm": 5.392994856020097,
+      "learning_rate": 3.276929084939967e-06,
+      "loss": 0.9885,
+      "step": 62
+    },
+    {
+      "epoch": 1.2857142857142856,
+      "grad_norm": 5.568535449393245,
+      "learning_rate": 3.2507489286432733e-06,
+      "loss": 0.993,
+      "step": 63
+    },
+    {
+      "epoch": 1.306122448979592,
+      "grad_norm": 5.1121872396505745,
+      "learning_rate": 3.2242119650953256e-06,
+      "loss": 0.9274,
+      "step": 64
+    },
+    {
+      "epoch": 1.3265306122448979,
+      "grad_norm": 5.038687234249487,
+      "learning_rate": 3.19732576462523e-06,
+      "loss": 1.0066,
+      "step": 65
+    },
+    {
+      "epoch": 1.346938775510204,
+      "grad_norm": 5.686879366948617,
+      "learning_rate": 3.170097997190615e-06,
+      "loss": 1.0032,
+      "step": 66
+    },
+    {
+      "epoch": 1.3673469387755102,
+      "grad_norm": 5.312762602694415,
+      "learning_rate": 3.1425364301895844e-06,
+      "loss": 0.9553,
+      "step": 67
+    },
+    {
+      "epoch": 1.3877551020408163,
+      "grad_norm": 4.940862521459705,
+      "learning_rate": 3.1146489262448726e-06,
+      "loss": 0.9473,
+      "step": 68
+    },
+    {
+      "epoch": 1.4081632653061225,
+      "grad_norm": 5.1441112950497745,
+      "learning_rate": 3.0864434409608376e-06,
+      "loss": 1.0159,
+      "step": 69
+    },
+    {
+      "epoch": 1.4285714285714286,
+      "grad_norm": 5.485127198500315,
+      "learning_rate": 3.0579280206539247e-06,
+      "loss": 0.9193,
+      "step": 70
+    },
+    {
+      "epoch": 1.4489795918367347,
+      "grad_norm": 5.438513772229916,
+      "learning_rate": 3.029110800057258e-06,
+      "loss": 1.0163,
+      "step": 71
+    },
+    {
+      "epoch": 1.469387755102041,
+      "grad_norm": 5.089093472934727,
+      "learning_rate": 3e-06,
+      "loss": 1.0361,
+      "step": 72
+    },
+    {
+      "epoch": 1.489795918367347,
+      "grad_norm": 4.971637129071151,
+      "learning_rate": 2.970603925062162e-06,
+      "loss": 0.973,
+      "step": 73
+    },
+    {
+      "epoch": 1.510204081632653,
+      "grad_norm": 5.336082215964221,
+      "learning_rate": 2.9409309612055114e-06,
+      "loss": 1.0018,
+      "step": 74
+    },
+    {
+      "epoch": 1.5306122448979593,
+      "grad_norm": 4.726728122616708,
+      "learning_rate": 2.9109895733812677e-06,
+      "loss": 0.9467,
+      "step": 75
+    },
+    {
+      "epoch": 1.5510204081632653,
+      "grad_norm": 5.658444364153749,
+      "learning_rate": 2.8807883031152685e-06,
+      "loss": 0.9402,
+      "step": 76
+    },
+    {
+      "epoch": 1.5714285714285714,
+      "grad_norm": 5.318192175322547,
+      "learning_rate": 2.850335766071281e-06,
+      "loss": 0.9771,
+      "step": 77
+    },
+    {
+      "epoch": 1.5918367346938775,
+      "grad_norm": 5.15866054072964,
+      "learning_rate": 2.8196406495931747e-06,
+      "loss": 0.9311,
+      "step": 78
+    },
+    {
+      "epoch": 1.6122448979591837,
+      "grad_norm": 5.122060161147712,
+      "learning_rate": 2.7887117102266372e-06,
+      "loss": 0.9289,
+      "step": 79
+    },
+    {
+      "epoch": 1.6326530612244898,
+      "grad_norm": 5.365443682206108,
+      "learning_rate": 2.757557771221152e-06,
+      "loss": 1.0086,
+      "step": 80
+    },
+    {
+      "epoch": 1.6530612244897958,
+      "grad_norm": 5.578125995371937,
+      "learning_rate": 2.726187720012949e-06,
+      "loss": 1.0213,
+      "step": 81
+    },
+    {
+      "epoch": 1.6734693877551021,
+      "grad_norm": 4.867474459234814,
+      "learning_rate": 2.69461050568964e-06,
+      "loss": 0.9611,
+      "step": 82
+    },
+    {
+      "epoch": 1.693877551020408,
+      "grad_norm": 5.134575732180386,
+      "learning_rate": 2.6628351364372716e-06,
+      "loss": 0.9465,
+      "step": 83
+    },
+    {
+      "epoch": 1.7142857142857144,
+      "grad_norm": 4.929124345246347,
+      "learning_rate": 2.6308706769705113e-06,
+      "loss": 0.9854,
+      "step": 84
+    },
+    {
+      "epoch": 1.7346938775510203,
+      "grad_norm": 5.361881799554932,
+      "learning_rate": 2.5987262459467165e-06,
+      "loss": 0.9219,
+      "step": 85
+    },
+    {
+      "epoch": 1.7551020408163265,
+      "grad_norm": 5.111629187737712,
+      "learning_rate": 2.5664110133646076e-06,
+      "loss": 0.9139,
+      "step": 86
+    },
+    {
+      "epoch": 1.7755102040816326,
+      "grad_norm": 5.233284173002549,
+      "learning_rate": 2.533934197948303e-06,
+      "loss": 0.9921,
+      "step": 87
+    },
+    {
+      "epoch": 1.7959183673469388,
+      "grad_norm": 4.986446843273751,
+      "learning_rate": 2.501305064517441e-06,
+      "loss": 0.9397,
+      "step": 88
+    },
+    {
+      "epoch": 1.816326530612245,
+      "grad_norm": 4.975196749685198,
+      "learning_rate": 2.468532921344164e-06,
+      "loss": 0.9643,
+      "step": 89
+    },
+    {
+      "epoch": 1.836734693877551,
+      "grad_norm": 5.0457233401836135,
+      "learning_rate": 2.4356271174977026e-06,
+      "loss": 0.9169,
+      "step": 90
+    },
+    {
+      "epoch": 1.8571428571428572,
+      "grad_norm": 5.534188821264441,
+      "learning_rate": 2.40259704017732e-06,
+      "loss": 0.9826,
+      "step": 91
+    },
+    {
+      "epoch": 1.8775510204081631,
+      "grad_norm": 5.119128865484249,
+      "learning_rate": 2.369452112034379e-06,
+      "loss": 0.8978,
+      "step": 92
+    },
+    {
+      "epoch": 1.8979591836734695,
+      "grad_norm": 5.059558900584382,
+      "learning_rate": 2.3362017884842965e-06,
+      "loss": 0.9653,
+      "step": 93
+    },
+    {
+      "epoch": 1.9183673469387754,
+      "grad_norm": 5.418073717960386,
+      "learning_rate": 2.3028555550091533e-06,
+      "loss": 0.924,
+      "step": 94
+    },
+    {
+      "epoch": 1.9387755102040818,
+      "grad_norm": 5.0451248325321805,
+      "learning_rate": 2.2694229244517222e-06,
+      "loss": 1.0111,
+      "step": 95
+    },
+    {
+      "epoch": 1.9591836734693877,
+      "grad_norm": 5.143777913795045,
+      "learning_rate": 2.2359134343016923e-06,
+      "loss": 0.9129,
+      "step": 96
+    },
+    {
+      "epoch": 1.9795918367346939,
+      "grad_norm": 5.05591838424157,
+      "learning_rate": 2.2023366439748643e-06,
+      "loss": 0.9551,
+      "step": 97
+    },
+    {
+      "epoch": 2.0,
+      "grad_norm": 5.043968948032216,
+      "learning_rate": 2.1687021320860892e-06,
+      "loss": 0.9724,
+      "step": 98
+    }
+  ],
+  "logging_steps": 1,
+  "max_steps": 196,
+  "num_input_tokens_seen": 0,
+  "num_train_epochs": 4,
+  "save_steps": 49,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": false
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 26753888157696.0,
+  "train_batch_size": 2,
+  "trial_name": null,
+  "trial_params": null
+}

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:45f88c4e7810ac105c5517846a31a9e8ed421e1a6e041c689c94c768124df5d6
+size 8056