Upload LlamaForCausalLM

Browse files

Files changed (7) hide show

config.json +4 -3
generation_config.json +1 -1
model-00001-of-00004.safetensors +2 -2
model-00002-of-00004.safetensors +2 -2
model-00003-of-00004.safetensors +2 -2
model-00004-of-00004.safetensors +2 -2
model.safetensors.index.json +15 -15

config.json CHANGED Viewed

@@ -6,12 +6,13 @@
   "attention_bias": false,
   "attention_dropout": 0.0,
   "bos_token_id": 128000,
-  "eos_token_id": 128001,
   "hidden_act": "silu",
   "hidden_size": 4096,
   "initializer_range": 0.02,
   "intermediate_size": 14336,
   "max_position_embeddings": 8192,
   "model_type": "llama",
   "num_attention_heads": 32,
   "num_hidden_layers": 32,
@@ -22,7 +23,7 @@
   "rope_theta": 500000.0,
   "tie_word_embeddings": false,
   "torch_dtype": "float16",
-  "transformers_version": "4.40.0",
   "use_cache": true,
-  "vocab_size": 128256
 }

   "attention_bias": false,
   "attention_dropout": 0.0,
   "bos_token_id": 128000,
+  "eos_token_id": 128009,
   "hidden_act": "silu",
   "hidden_size": 4096,
   "initializer_range": 0.02,
   "intermediate_size": 14336,
   "max_position_embeddings": 8192,
+  "mlp_bias": false,
   "model_type": "llama",
   "num_attention_heads": 32,
   "num_hidden_layers": 32,
   "rope_theta": 500000.0,
   "tie_word_embeddings": false,
   "torch_dtype": "float16",
+  "transformers_version": "4.41.0",
   "use_cache": true,
+  "vocab_size": 145793
 }

generation_config.json CHANGED Viewed

@@ -8,5 +8,5 @@
   "max_length": 4096,
   "temperature": 0.6,
   "top_p": 0.9,
-  "transformers_version": "4.40.0"
 }

   "max_length": 4096,
   "temperature": 0.6,
   "top_p": 0.9,
+  "transformers_version": "4.41.0"
 }

model-00001-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:6874219e25322d93b521837d439ad75545f5b941c4ab3a1237f0b44363d4c2cc
-size 4976698592

 version https://git-lfs.github.com/spec/v1
+oid sha256:44541e8056bd668b5582963714515bb10533a31c01b51384af759c1f123f22b1
+size 4885463832

model-00002-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:4122d4e3d1cba1b1a79f188cc3ad944528f747f155b5d4cb196e67787c02e577
-size 4999802616

 version https://git-lfs.github.com/spec/v1
+oid sha256:d717090d6e117e98d32cd104b05e0a87636e71e8dc966be0280e696690adbb88
+size 4915916056

model-00003-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:f397fe539eac0f6b4ccb9646b84f57451dec1f243f66c5efc54dd73b6c9453a7
-size 4915916080

 version https://git-lfs.github.com/spec/v1
+oid sha256:37a05ce080f5195ddb6cbd8f58da44eaf487615454d10e51de57b5a637bcf6fa
+size 4999819232

model-00004-of-00004.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:86dab6d3f24a91f09ec84c04931fb4f465e131135f372a75f44f2f388503e2a6
-size 1168138808

 version https://git-lfs.github.com/spec/v1
+oid sha256:60ac679e18a59c3eb3e3bd7f5d58ecf3d2b93d379e1fb2a78cc71feff86b0207
+size 1546683160

model.safetensors.index.json CHANGED Viewed

@@ -1,6 +1,6 @@
 {
   "metadata": {
-    "total_size": 16060522496
   },
   "weight_map": {
     "lm_head.weight": "model-00004-of-00004.safetensors",
@@ -104,11 +104,11 @@
     "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
@@ -124,13 +124,13 @@
     "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
-    "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
-    "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
@@ -232,8 +232,8 @@
     "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
-    "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
-    "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
@@ -275,11 +275,11 @@
     "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
-    "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",

 {
   "metadata": {
+    "total_size": 16347848704
   },
   "weight_map": {
     "lm_head.weight": "model-00004-of-00004.safetensors",
     "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
     "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
     "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
     "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
     "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
     "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",