Add files using large-upload tool

Browse files

Files changed (6) hide show

README.md +181 -0
config.json +32 -0
model.safetensors.index.json +370 -0
special_tokens_map.json +12 -0
tokenizer.json +0 -0
tokenizer_config.json +81 -0

README.md ADDED Viewed

	@@ -0,0 +1,181 @@

+---
+license: llama2
+datasets:
+- ACE05
+- bc5cdr
+- conll2003
+- ncbi_disease
+- conll2012_ontonotesv5
+- rams
+- tacred
+- wnut_17
+language:
+- en
+metrics:
+- f1
+pipeline_tag: text-generation
+tags:
+- code
+- text-generation-inference
+- Information Extraction
+- IE
+- Named Entity Recogniton
+- Event Extraction
+- Relation Extraction
+- LLaMA
+---
+<p align="center">
+    <br>
+    <img src="https://github.com/hitz-zentroa/GoLLIE/raw/main/assets/GoLLIE.png" style="height: 250px;">
+    <h2 align="center"><b>G</b>uideline f<b>o</b>llowing <b>L</b>arge <b>L</b>anguage Model for <b>I</b>nformation <b>E</b>xtraction</h2>
+    <br>
+# Model Card for GoLLIE 13B
+<p align="justify">
+We present GoLLIE, a Large Language Model trained to follow annotation guidelines. GoLLIE outperforms previous approaches on zero-shot Information Extraction and allows the user to perform inferences with annotation schemas defined on the fly. Different from previous approaches, GoLLIE is able to follow detailed definitions and does not only rely on the knowledge already encoded in the LLM.
+- 💻 Code: [https://github.com/osainz59/CoLLIE/](https://github.com/hitz-zentroa/GoLLIE)
+- 📒 Blog Post: [GoLLIE: Guideline-following Large Language Model for Information Extraction](https://hitz-zentroa.github.io/GoLLIE/)
+- 📖 Paper: [GoLLIE: Annotation Guidelines improve Zero-Shot Information-Extraction](https://arxiv.org/abs/2310.03668)
+- 🐕 GoLLIE Colection in the 🤗HuggingFace Hub: [HiTZ/gollie](https://huggingface.co/collections/HiTZ/gollie-651bf19ee315e8a224aacc4f)
+- 🚀 Example Jupyter Notebooks: [GoLLIE Notebooks](https://github.com/hitz-zentroa/GoLLIE/tree/main/notebooks)
+</p>
+<p align="center">
+<img src="https://github.com/hitz-zentroa/GoLLIE/raw/main/assets/zero_shot_results.png">
+</p>
+### Model Description
+- **Developed by:** [Oscar Sainz](https://osainz59.github.io/), [Iker García-Ferrero](https://ikergarcia1996.github.io/Iker-Garcia-Ferrero/), [Rodrigo Agerri](https://ragerri.github.io/), [Oier Lopez de Lacalle](https://oierldl.github.io/), [German Rigau](https://adimen.si.ehu.es/~rigau/) and [Eneko Agirre](https://eagirre.github.io/)
+- **Institution:** [HiTZ Basque Center for Language Technology](http://www.hitz.eus/) - [Ixa](https://www.ixa.eus/node/2?language=en), [University of the Basque Country UPV/EHU](https://www.ehu.eus/en/en-home)
+- **Model type:** Text Generation
+- **Language(s) (NLP):** English
+- **License:** LLaMA2 License for the base and merged model. Apache 2.0 for pre-trained LoRA Adapters
+- **Finetuned from model:** CODE-LLaMA2
+## Schema definition and inference example
+The labels are represented as Python classes, and the guidelines or instructions are introduced as docstrings. The model start generating after the `result = [` line.
+```Python
+# Entity definitions
+@dataclass
+class Launcher(Template):
+    """Refers to a vehicle designed primarily to transport payloads from the Earth's
+    surface to space. Launchers can carry various payloads, including satellites,
+    crewed spacecraft, and cargo, into various orbits or even beyond Earth's orbit.
+    They are usually multi-stage vehicles that use rocket engines for propulsion."""
+    mention: str
+    """
+    The name of the launcher vehicle.
+    Such as: "Sturn V", "Atlas V", "Soyuz", "Ariane 5"
+    """
+    space_company: str # The company that operates the launcher. Such as: "Blue origin", "ESA", "Boeing", "ISRO", "Northrop Grumman", "Arianespace"
+    crew: List[str] # Names of the crew members boarding the Launcher. Such as: "Neil Armstrong", "Michael Collins", "Buzz Aldrin"
+@dataclass
+class Mission(Template):
+    """Any planned or accomplished journey beyond Earth's atmosphere with specific objectives,
+    either crewed or uncrewed. It includes missions to satellites, the International
+    Space Station (ISS), other celestial bodies, and deep space."""
+    mention: str
+    """
+    The name of the mission.
+    Such as: "Apollo 11", "Artemis", "Mercury"
+    """
+    date: str # The start date of the mission
+    departure: str # The place from which the vehicle will be launched. Such as: "Florida", "Houston", "French Guiana"
+    destination: str # The place or planet to which the launcher will be sent. Such as "Moon", "low-orbit", "Saturn"
+# This is the text to analyze
+text = (
+    "The Ares 3 mission to Mars is scheduled for 2032. The Starship rocket build by SpaceX will take off from Boca Chica,"
+    "carrying the astronauts Max Rutherford, Elena Soto, and Jake Martinez."
+)
+# The annotation instances that take place in the text above are listed here
+result = [
+    Mission(mention='Ares 3', date='2032', departure='Boca Chica', destination='Mars'),
+    Launcher(mention='Starship', space_company='SpaceX', crew=['Max Rutherford', 'Elena Soto', 'Jake Martinez'])
+]
+```
+## How to Get Started with the Model
+Please read our [🚀 Example Jupyter Notebooks](https://github.com/hitz-zentroa/GoLLIE/tree/main/notebooks) to get started with GoLLIE.
+The best way to load the model is using our custom `load_model` fuction. However, you can also load them using the AutoModelForCausalLM class.
+**Important**: Our flash attention implementation has small numerical differences compared to the attention implementation in Huggingface.
+You must use the flag `trust_remote_code=True` or you will get inferior results. Flash attention requires an available CUDA GPU. Running GOLLIE
+pre-trained models on a CPU is not supported. We plan to address this in future releases. First, install flash attention 2:
+```bash
+pip install flash-attn --no-build-isolation
+pip install git+https://github.com/HazyResearch/flash-attention.git#subdirectory=csrc/rotary
+```
+Then you can load the model using
+```python
+import torch
+from transformers import AutoTokenizer, AutoModelForCausalLM
+tokenizer = AutoTokenizer.from_pretrained("HiTZ/GoLLIE-7B")
+model = AutoModelForCausalLM.from_pretrained("HiTZ/GoLLIE-7B", trust_remote_code=True, torch_dtype=torch.bfloat16)
+model.to("cuda")
+```
+Read our [🚀 Example Jupyter Notebooks](https://github.com/hitz-zentroa/GoLLIE/tree/main/notebooks) to learn how to easily define guidelines, generate model inputs and parse the output!
+### Training Data
+This is the list of task used for training and evaluating GoLLIE. However, as demonstrated in the  🚀 [Create Custom Task notebook](https://github.com/hitz-zentroa/GoLLIE/blob/main/notebooks/Create%20Custom%20Task.ipynb) GoLLIE can perform a wide range of unseen tasks.
+For more info, read our [📖Paper](https://arxiv.org/abs/2310.03668).
+<p align="center">
+<img src="https://github.com/hitz-zentroa/GoLLIE/raw/main/assets/datasets.png">
+</p>
+## Evaluation
+| Model | Supervised average F1 | Zero-shot average F1 |                     🤗HuggingFace Hub                     |
+|---|:---------------------:|:--------------------:|:---------------------------------------------------------:|
+| GoLLIE-7B |         73.0          |         55.3         |  [HiTZ/GoLLIE-7B](https://huggingface.co/HiTZ/GoLLIE-7B)  |
+| GoLLIE-13B |         73.9          |         56.0         | [HiTZ/GoLLIE-13B](https://huggingface.co/HiTZ/GoLLIE-13B) |
+| GoLLIE-34B |       **75.0**        |       **57.2**       | [HiTZ/GoLLIE-34B](https://huggingface.co/HiTZ/GoLLIE-34B) |
+## Environmental Impact
+| Model | Hardware | FLOPs            | Time (h) | CO<sup>2</sup>eq (kg) |
+|----------------|-------------------|---------------------------|-------------------|-------------------------------------|
+| GoLLIE 7B       | 1xA100            | 11.9e<sup>18</sup> | 44.5              | 1.57                                |
+| GoLLIE 13B    | 1xA100            | 22.7e<sup>18</sup> | 79.5              | 2.80                                |
+| GoLLIE 34B    | 2xA100            | 55.8e<sup>18</sup> | 94.6              | 6.67                                |
+## Citation
+```
+@misc{sainz2023gollie,
+      title={GoLLIE: Annotation Guidelines improve Zero-Shot Information-Extraction},
+      author={Oscar Sainz and Iker García-Ferrero and Rodrigo Agerri and Oier Lopez de Lacalle and German Rigau and Eneko Agirre},
+      year={2023},
+      eprint={2310.03668},
+      archivePrefix={arXiv},
+      primaryClass={cs.CL}
+}
+```

config.json ADDED Viewed

	@@ -0,0 +1,32 @@

+{
+  "_name_or_path": ".",
+  "architectures": [
+    "LlamaForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "auto_map": {
+    "AutoModelForCausalLM": "modeling_flash_llama.LlamaForCausalLM"
+  },
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "hidden_act": "silu",
+  "hidden_size": 5120,
+  "initializer_range": 0.02,
+  "intermediate_size": 13824,
+  "max_position_embeddings": 16384,
+  "mlp_bias": false,
+  "model_type": "llama",
+  "num_attention_heads": 40,
+  "num_hidden_layers": 40,
+  "num_key_value_heads": 40,
+  "pretraining_tp": 1,
+  "rms_norm_eps": 1e-05,
+  "rope_scaling": null,
+  "rope_theta": 1000000,
+  "tie_word_embeddings": false,
+  "torch_dtype": "float32",
+  "transformers_version": "4.44.2",
+  "use_cache": true,
+  "vocab_size": 32016
+}

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,370 @@

+{
+  "metadata": {
+    "total_size": 52064112640
+  },
+  "weight_map": {
+    "lm_head.weight": "model-00011-of-00011.safetensors",
+    "model.embed_tokens.weight": "model-00001-of-00011.safetensors",
+    "model.layers.0.input_layernorm.weight": "model-00001-of-00011.safetensors",
+    "model.layers.0.mlp.down_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.0.mlp.up_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00011.safetensors",
+    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.1.input_layernorm.weight": "model-00001-of-00011.safetensors",
+    "model.layers.1.mlp.down_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.1.mlp.up_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00011.safetensors",
+    "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.10.input_layernorm.weight": "model-00003-of-00011.safetensors",
+    "model.layers.10.mlp.down_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.10.mlp.gate_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.10.mlp.up_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.10.post_attention_layernorm.weight": "model-00003-of-00011.safetensors",
+    "model.layers.10.self_attn.k_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.10.self_attn.o_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.10.self_attn.q_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.10.self_attn.v_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.11.input_layernorm.weight": "model-00004-of-00011.safetensors",
+    "model.layers.11.mlp.down_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.11.mlp.gate_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.11.mlp.up_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.11.post_attention_layernorm.weight": "model-00004-of-00011.safetensors",
+    "model.layers.11.self_attn.k_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.11.self_attn.o_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.11.self_attn.q_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.11.self_attn.v_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.12.input_layernorm.weight": "model-00004-of-00011.safetensors",
+    "model.layers.12.mlp.down_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.12.mlp.gate_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.12.mlp.up_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.12.post_attention_layernorm.weight": "model-00004-of-00011.safetensors",
+    "model.layers.12.self_attn.k_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.12.self_attn.o_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.12.self_attn.q_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.12.self_attn.v_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.13.input_layernorm.weight": "model-00004-of-00011.safetensors",
+    "model.layers.13.mlp.down_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.13.mlp.gate_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.13.mlp.up_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.13.post_attention_layernorm.weight": "model-00004-of-00011.safetensors",
+    "model.layers.13.self_attn.k_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.13.self_attn.o_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.13.self_attn.q_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.13.self_attn.v_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.14.input_layernorm.weight": "model-00004-of-00011.safetensors",
+    "model.layers.14.mlp.down_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.14.mlp.gate_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.14.mlp.up_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.14.post_attention_layernorm.weight": "model-00004-of-00011.safetensors",
+    "model.layers.14.self_attn.k_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.14.self_attn.o_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.14.self_attn.q_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.14.self_attn.v_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.15.input_layernorm.weight": "model-00005-of-00011.safetensors",
+    "model.layers.15.mlp.down_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.15.mlp.gate_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.15.mlp.up_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.15.post_attention_layernorm.weight": "model-00005-of-00011.safetensors",
+    "model.layers.15.self_attn.k_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.15.self_attn.o_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.15.self_attn.q_proj.weight": "model-00004-of-00011.safetensors",
+    "model.layers.15.self_attn.v_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.16.input_layernorm.weight": "model-00005-of-00011.safetensors",
+    "model.layers.16.mlp.down_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.16.mlp.gate_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.16.mlp.up_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.16.post_attention_layernorm.weight": "model-00005-of-00011.safetensors",
+    "model.layers.16.self_attn.k_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.16.self_attn.o_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.16.self_attn.q_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.16.self_attn.v_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.17.input_layernorm.weight": "model-00005-of-00011.safetensors",
+    "model.layers.17.mlp.down_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.17.mlp.gate_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.17.mlp.up_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.17.post_attention_layernorm.weight": "model-00005-of-00011.safetensors",
+    "model.layers.17.self_attn.k_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.17.self_attn.o_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.17.self_attn.q_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.17.self_attn.v_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.18.input_layernorm.weight": "model-00005-of-00011.safetensors",
+    "model.layers.18.mlp.down_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.18.mlp.gate_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.18.mlp.up_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.18.post_attention_layernorm.weight": "model-00005-of-00011.safetensors",
+    "model.layers.18.self_attn.k_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.18.self_attn.o_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.18.self_attn.q_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.18.self_attn.v_proj.weight": "model-00005-of-00011.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00006-of-00011.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00006-of-00011.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.2.input_layernorm.weight": "model-00001-of-00011.safetensors",
+    "model.layers.2.mlp.down_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.2.mlp.up_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00011.safetensors",
+    "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.20.input_layernorm.weight": "model-00006-of-00011.safetensors",
+    "model.layers.20.mlp.down_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.20.mlp.up_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.20.post_attention_layernorm.weight": "model-00006-of-00011.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.21.input_layernorm.weight": "model-00006-of-00011.safetensors",
+    "model.layers.21.mlp.down_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.21.mlp.gate_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.21.mlp.up_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.21.post_attention_layernorm.weight": "model-00006-of-00011.safetensors",
+    "model.layers.21.self_attn.k_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.21.self_attn.o_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.21.self_attn.q_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.21.self_attn.v_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.22.input_layernorm.weight": "model-00007-of-00011.safetensors",
+    "model.layers.22.mlp.down_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.22.mlp.gate_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.22.mlp.up_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.22.post_attention_layernorm.weight": "model-00007-of-00011.safetensors",
+    "model.layers.22.self_attn.k_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.22.self_attn.o_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.22.self_attn.q_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.22.self_attn.v_proj.weight": "model-00006-of-00011.safetensors",
+    "model.layers.23.input_layernorm.weight": "model-00007-of-00011.safetensors",
+    "model.layers.23.mlp.down_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.23.mlp.gate_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.23.mlp.up_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.23.post_attention_layernorm.weight": "model-00007-of-00011.safetensors",
+    "model.layers.23.self_attn.k_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.23.self_attn.o_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.23.self_attn.q_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.23.self_attn.v_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.24.input_layernorm.weight": "model-00007-of-00011.safetensors",
+    "model.layers.24.mlp.down_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.24.mlp.gate_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.24.mlp.up_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.24.post_attention_layernorm.weight": "model-00007-of-00011.safetensors",
+    "model.layers.24.self_attn.k_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.24.self_attn.o_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.24.self_attn.q_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.24.self_attn.v_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.25.input_layernorm.weight": "model-00007-of-00011.safetensors",
+    "model.layers.25.mlp.down_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.25.mlp.gate_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.25.mlp.up_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.25.post_attention_layernorm.weight": "model-00007-of-00011.safetensors",
+    "model.layers.25.self_attn.k_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.25.self_attn.o_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.25.self_attn.q_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.25.self_attn.v_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.26.input_layernorm.weight": "model-00008-of-00011.safetensors",
+    "model.layers.26.mlp.down_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.26.mlp.gate_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.26.mlp.up_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.26.post_attention_layernorm.weight": "model-00008-of-00011.safetensors",
+    "model.layers.26.self_attn.k_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.26.self_attn.o_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.26.self_attn.q_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.26.self_attn.v_proj.weight": "model-00007-of-00011.safetensors",
+    "model.layers.27.input_layernorm.weight": "model-00008-of-00011.safetensors",
+    "model.layers.27.mlp.down_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.27.mlp.gate_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.27.mlp.up_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.27.post_attention_layernorm.weight": "model-00008-of-00011.safetensors",
+    "model.layers.27.self_attn.k_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.27.self_attn.o_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.27.self_attn.q_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.27.self_attn.v_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.28.input_layernorm.weight": "model-00008-of-00011.safetensors",
+    "model.layers.28.mlp.down_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.28.mlp.gate_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.28.mlp.up_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.28.post_attention_layernorm.weight": "model-00008-of-00011.safetensors",
+    "model.layers.28.self_attn.k_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.28.self_attn.o_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.28.self_attn.q_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.28.self_attn.v_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.29.input_layernorm.weight": "model-00008-of-00011.safetensors",
+    "model.layers.29.mlp.down_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.29.mlp.gate_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.29.mlp.up_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.29.post_attention_layernorm.weight": "model-00008-of-00011.safetensors",
+    "model.layers.29.self_attn.k_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.29.self_attn.o_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.29.self_attn.q_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.29.self_attn.v_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.3.input_layernorm.weight": "model-00002-of-00011.safetensors",
+    "model.layers.3.mlp.down_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.3.mlp.gate_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.3.mlp.up_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.3.post_attention_layernorm.weight": "model-00002-of-00011.safetensors",
+    "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00011.safetensors",
+    "model.layers.30.input_layernorm.weight": "model-00009-of-00011.safetensors",
+    "model.layers.30.mlp.down_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.30.mlp.gate_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.30.mlp.up_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.30.post_attention_layernorm.weight": "model-00009-of-00011.safetensors",
+    "model.layers.30.self_attn.k_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.30.self_attn.o_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.30.self_attn.q_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.30.self_attn.v_proj.weight": "model-00008-of-00011.safetensors",
+    "model.layers.31.input_layernorm.weight": "model-00009-of-00011.safetensors",
+    "model.layers.31.mlp.down_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.31.post_attention_layernorm.weight": "model-00009-of-00011.safetensors",
+    "model.layers.31.self_attn.k_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.31.self_attn.o_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.31.self_attn.q_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.31.self_attn.v_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.32.input_layernorm.weight": "model-00009-of-00011.safetensors",
+    "model.layers.32.mlp.down_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.32.mlp.gate_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.32.mlp.up_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.32.post_attention_layernorm.weight": "model-00009-of-00011.safetensors",
+    "model.layers.32.self_attn.k_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.32.self_attn.o_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.32.self_attn.q_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.32.self_attn.v_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.33.input_layernorm.weight": "model-00009-of-00011.safetensors",
+    "model.layers.33.mlp.down_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.33.mlp.gate_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.33.mlp.up_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.33.post_attention_layernorm.weight": "model-00009-of-00011.safetensors",
+    "model.layers.33.self_attn.k_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.33.self_attn.o_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.33.self_attn.q_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.33.self_attn.v_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.34.input_layernorm.weight": "model-00010-of-00011.safetensors",
+    "model.layers.34.mlp.down_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.34.mlp.gate_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.34.mlp.up_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.34.post_attention_layernorm.weight": "model-00010-of-00011.safetensors",
+    "model.layers.34.self_attn.k_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.34.self_attn.o_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.34.self_attn.q_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.34.self_attn.v_proj.weight": "model-00009-of-00011.safetensors",
+    "model.layers.35.input_layernorm.weight": "model-00010-of-00011.safetensors",
+    "model.layers.35.mlp.down_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.35.mlp.gate_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.35.mlp.up_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.35.post_attention_layernorm.weight": "model-00010-of-00011.safetensors",
+    "model.layers.35.self_attn.k_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.35.self_attn.o_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.35.self_attn.q_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.35.self_attn.v_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.36.input_layernorm.weight": "model-00010-of-00011.safetensors",
+    "model.layers.36.mlp.down_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.36.mlp.gate_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.36.mlp.up_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.36.post_attention_layernorm.weight": "model-00010-of-00011.safetensors",
+    "model.layers.36.self_attn.k_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.36.self_attn.o_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.36.self_attn.q_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.36.self_attn.v_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.37.input_layernorm.weight": "model-00010-of-00011.safetensors",
+    "model.layers.37.mlp.down_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.37.mlp.gate_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.37.mlp.up_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.37.post_attention_layernorm.weight": "model-00010-of-00011.safetensors",
+    "model.layers.37.self_attn.k_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.37.self_attn.o_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.37.self_attn.q_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.37.self_attn.v_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.38.input_layernorm.weight": "model-00011-of-00011.safetensors",
+    "model.layers.38.mlp.down_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.38.mlp.gate_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.38.mlp.up_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.38.post_attention_layernorm.weight": "model-00011-of-00011.safetensors",
+    "model.layers.38.self_attn.k_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.38.self_attn.o_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.38.self_attn.q_proj.weight": "model-00010-of-00011.safetensors",
+    "model.layers.38.self_attn.v_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.39.input_layernorm.weight": "model-00011-of-00011.safetensors",
+    "model.layers.39.mlp.down_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.39.mlp.gate_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.39.mlp.up_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.39.post_attention_layernorm.weight": "model-00011-of-00011.safetensors",
+    "model.layers.39.self_attn.k_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.39.self_attn.o_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.39.self_attn.q_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.39.self_attn.v_proj.weight": "model-00011-of-00011.safetensors",
+    "model.layers.4.input_layernorm.weight": "model-00002-of-00011.safetensors",
+    "model.layers.4.mlp.down_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.4.mlp.gate_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.4.mlp.up_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.4.post_attention_layernorm.weight": "model-00002-of-00011.safetensors",
+    "model.layers.4.self_attn.k_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.4.self_attn.o_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.4.self_attn.q_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.4.self_attn.v_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.5.input_layernorm.weight": "model-00002-of-00011.safetensors",
+    "model.layers.5.mlp.down_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.5.mlp.gate_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.5.mlp.up_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.5.post_attention_layernorm.weight": "model-00002-of-00011.safetensors",
+    "model.layers.5.self_attn.k_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.5.self_attn.o_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.5.self_attn.q_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.5.self_attn.v_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.6.input_layernorm.weight": "model-00002-of-00011.safetensors",
+    "model.layers.6.mlp.down_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.6.mlp.up_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00011.safetensors",
+    "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.6.self_attn.o_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.7.input_layernorm.weight": "model-00003-of-00011.safetensors",
+    "model.layers.7.mlp.down_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.7.mlp.gate_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.7.mlp.up_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.7.post_attention_layernorm.weight": "model-00003-of-00011.safetensors",
+    "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.7.self_attn.o_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.7.self_attn.q_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00011.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00003-of-00011.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.8.mlp.gate_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00003-of-00011.safetensors",
+    "model.layers.8.self_attn.k_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.8.self_attn.o_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.8.self_attn.q_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.8.self_attn.v_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.9.input_layernorm.weight": "model-00003-of-00011.safetensors",
+    "model.layers.9.mlp.down_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.9.mlp.gate_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.9.mlp.up_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.9.post_attention_layernorm.weight": "model-00003-of-00011.safetensors",
+    "model.layers.9.self_attn.k_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.9.self_attn.o_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.9.self_attn.q_proj.weight": "model-00003-of-00011.safetensors",
+    "model.layers.9.self_attn.v_proj.weight": "model-00003-of-00011.safetensors",
+    "model.norm.weight": "model-00011-of-00011.safetensors"
+  }
+}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,12 @@

+{
+  "additional_special_tokens": [
+    "▁<PRE>",
+    "▁<MID>",
+    "▁<SUF>",
+    "▁<EOT>"
+  ],
+  "bos_token": "<s>",
+  "eos_token": "</s>",
+  "pad_token": "<unk>",
+  "unk_token": "<unk>"
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,81 @@

+{
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<unk>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "32007": {
+      "content": "▁<PRE>",
+      "lstrip": true,
+      "normalized": false,
+      "rstrip": true,
+      "single_word": false,
+      "special": true
+    },
+    "32008": {
+      "content": "▁<SUF>",
+      "lstrip": true,
+      "normalized": false,
+      "rstrip": true,
+      "single_word": false,
+      "special": true
+    },
+    "32009": {
+      "content": "▁<MID>",
+      "lstrip": true,
+      "normalized": false,
+      "rstrip": true,
+      "single_word": false,
+      "special": true
+    },
+    "32010": {
+      "content": "▁<EOT>",
+      "lstrip": true,
+      "normalized": false,
+      "rstrip": true,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [
+    "▁<PRE>",
+    "▁<MID>",
+    "▁<SUF>",
+    "▁<EOT>"
+  ],
+  "bos_token": "<s>",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "</s>",
+  "eot_token": "▁<EOT>",
+  "fill_token": "<FILL_ME>",
+  "legacy": null,
+  "middle_token": "▁<MID>",
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": null,
+  "prefix_token": "▁<PRE>",
+  "sp_model_kwargs": {},
+  "suffix_token": "▁<SUF>",
+  "tokenizer_class": "CodeLlamaTokenizer",
+  "unk_token": "<unk>",
+  "use_default_system_prompt": false
+}