Upload LlamaForCausalLM

Browse files

Files changed (7) hide show

config.json +2 -2
generation_config.json +3 -3
model-00001-of-00004.safetensors +2 -2
model-00002-of-00004.safetensors +2 -2
model-00003-of-00004.safetensors +2 -2
model-00004-of-00004.safetensors +2 -2
model.safetensors.index.json +15 -15

config.json CHANGED Viewed

@@ -23,7 +23,7 @@
   "rope_theta": 500000.0,
   "tie_word_embeddings": false,
   "torch_dtype": "float16",
-  "transformers_version": "4.41.0",
   "use_cache": true,
-  "vocab_size": 145793
 }

   "rope_theta": 500000.0,
   "tie_word_embeddings": false,
   "torch_dtype": "float16",
+  "transformers_version": "4.41.2",
   "use_cache": true,
+  "vocab_size": 128256
 }

generation_config.json CHANGED Viewed

@@ -1,12 +1,12 @@
 {
   "bos_token_id": 128000,
-  "do_sample": false,
   "eos_token_id": [
     128001,
     128009
   ],
-  "max_length": 8192,
   "temperature": 0.6,
   "top_p": 0.9,
-  "transformers_version": "4.41.0"
 }

 {
   "bos_token_id": 128000,
+  "do_sample": true,
   "eos_token_id": [
     128001,
     128009
   ],
+  "max_length": 4096,
   "temperature": 0.6,
   "top_p": 0.9,
+  "transformers_version": "4.41.2"
 }

model-00001-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:4fb12eba0f8137e4f73d943e5a206fc15fbc2d61714954c6030fd5cd31428b62
-size 4885463832

 version https://git-lfs.github.com/spec/v1
+oid sha256:409fed81ea945bdcc7297f987a95f95a5b057e98dfb41d8f9f19598db0bb463b
+size 4976698592

model-00002-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:1af891e3d4566ead818511d23bf2fd8dd12992da6b6c59c5a14c5c34223bf377
-size 4915916056

 version https://git-lfs.github.com/spec/v1
+oid sha256:1c5c1a762dfe72a51778f4c9b1fc0414c06b42a7d4a5ff849bb68fd490eca16a
+size 4999802616

model-00003-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:520d8b48f3092798a976ba1bc18d9cda3a00a730af3ee77902a2e8164f67dad7
-size 4999819232

 version https://git-lfs.github.com/spec/v1
+oid sha256:1f86839802e851c1689340fd06b740273059ef3da108f02d1cac8f1de4b18add
+size 4915916080

model-00004-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:f87f023e5d0184c5cdc7ca363ce241fc707ba21794a8bc87ba4a308383ab81e4
-size 1546683160

 version https://git-lfs.github.com/spec/v1
+oid sha256:88d70d5950ba4a7d07a1525bb4a500eb02ce55fd78d2d88d0827d6ca582ab442
+size 1168138808

model.safetensors.index.json CHANGED Viewed

@@ -1,6 +1,6 @@
 {
   "metadata": {
-    "total_size": 16347848704
   },
   "weight_map": {
     "lm_head.weight": "model-00004-of-00004.safetensors",
@@ -104,11 +104,11 @@
     "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.input_layernorm.weight": "model-00003-of-00004.safetensors",
-    "model.layers.19.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
@@ -124,13 +124,13 @@
     "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.20.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
-    "model.layers.20.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.20.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.20.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.20.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
@@ -232,8 +232,8 @@
     "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
-    "model.layers.31.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
-    "model.layers.31.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
@@ -275,11 +275,11 @@
     "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.input_layernorm.weight": "model-00002-of-00004.safetensors",
-    "model.layers.8.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.8.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
     "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",

 {
   "metadata": {
+    "total_size": 16060522496
   },
   "weight_map": {
     "lm_head.weight": "model-00004-of-00004.safetensors",
     "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",