Tanuki-8B-dpo-v1.0-4k-GPTQ-8bit / tokenizer_config.json

Upload tokenizer

77b148e verified 3 months ago

8.03 kB

	{
	"added_tokens_decoder": {
	"0": {
	"content": "<unk>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"1": {
	"content": "<s>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"2": {
	"content": "</s>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"3": {
	"content": "<pad>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"4": {
	"content": "<CLS>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"5": {
	"content": "<SEP>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"6": {
	"content": "<EOD>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"7": {
	"content": "<MASK>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"9": {
	"content": "<llm-code>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"10": {
	"content": "</llm-code>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"11": {
	"content": "<llm-code-output>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"12": {
	"content": "</llm-code-output>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65000": {
	"content": "[PAD]",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65001": {
	"content": "<extra_id_0>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65002": {
	"content": "<extra_id_1>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65003": {
	"content": "<extra_id_2>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65004": {
	"content": "<extra_id_3>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65005": {
	"content": "<extra_id_4>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65006": {
	"content": "<extra_id_5>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65007": {
	"content": "<extra_id_6>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65008": {
	"content": "<extra_id_7>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65009": {
	"content": "<extra_id_8>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65010": {
	"content": "<extra_id_9>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65011": {
	"content": "<extra_id_10>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65012": {
	"content": "<extra_id_11>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65013": {
	"content": "<extra_id_12>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65014": {
	"content": "<extra_id_13>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65015": {
	"content": "<extra_id_14>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65016": {
	"content": "<extra_id_15>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65017": {
	"content": "<extra_id_16>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65018": {
	"content": "<extra_id_17>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65019": {
	"content": "<extra_id_18>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65020": {
	"content": "<extra_id_19>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65021": {
	"content": "<extra_id_20>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65022": {
	"content": "<extra_id_21>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"65023": {
	"content": "<extra_id_22>",
	"lstrip": false,
	"normalized": false,
	"rstrip": false,
	"single_word": false,
	"special": true
	}
	},
	"additional_special_tokens": [
	"<extra_id_0>",
	"<extra_id_1>",
	"<extra_id_2>",
	"<extra_id_3>",
	"<extra_id_4>",
	"<extra_id_5>",
	"<extra_id_6>",
	"<extra_id_7>",
	"<extra_id_8>",
	"<extra_id_9>",
	"<extra_id_10>",
	"<extra_id_11>",
	"<extra_id_12>",
	"<extra_id_13>",
	"<extra_id_14>",
	"<extra_id_15>",
	"<extra_id_16>",
	"<extra_id_17>",
	"<extra_id_18>",
	"<extra_id_19>",
	"<extra_id_20>",
	"<extra_id_21>",
	"<extra_id_22>"
	],
	"bos_token": "<s>",
	"chat_template": "{% if messages[0]['role'] == 'system' %}{% set system_message = messages[0]['content'] %}{% set messages = messages[1:] %}{% else %}{% set system_message = '以下は、タスクを説明する指示です。要求を適切に満たす応答を書きなさい。' %}{% endif %}{{　bos_token }}{{　system_message　}}{% for message in messages %}{% if message['role'] == 'user' %}{{ '\n\n### 指示:\n' + message['content'] }}{% elif message['role'] == 'assistant' %}{{ '\n\n### 応答:\n' + message['content'] + eos_token }}{% endif %}{% if loop.last and add_generation_prompt %}{{ '\n\n### 応答:\n' }}{% endif %}{% endfor %}",
	"clean_up_tokenization_spaces": false,
	"cls_token": "<CLS>",
	"eos_token": "</s>",
	"extra_ids": 0,
	"legacy": false,
	"mask_token": "<MASK>",
	"max_length": 1000000000000000019884624838656,
	"model_max_length": 1000000000000000019884624838656,
	"pad_token": "[PAD]",
	"sep_token": "<SEP>",
	"sp_model_kwargs": {},
	"stride": 0,
	"tokenizer_class": "PreTrainedTokenizerFast",
	"truncation_side": "right",
	"truncation_strategy": "longest_first",
	"unk_token": "<unk>"
	}