Sajjo
/

wav2vec2-large-xls-r-300m-tamil-v1

Inference Endpoints

Model card Files Files and versions Community

Sajjo commited on May 7

Commit

05ce444

•

1 Parent(s): a67f127

Upload tokenizer

Files changed (3) hide show

added_tokens.json +2 -2
tokenizer_config.json +4 -4
vocab.json +51 -65

added_tokens.json CHANGED Viewed

@@ -1,4 +1,4 @@
 {
-  "</s>": 67,
-  "<s>": 66
 }

 {
+  "</s>": 53,
+  "<s>": 52
 }

tokenizer_config.json CHANGED Viewed

@@ -1,6 +1,6 @@
 {
   "added_tokens_decoder": {
-    "64": {
       "content": "[UNK]",
       "lstrip": true,
       "normalized": false,
@@ -8,7 +8,7 @@
       "single_word": false,
       "special": false
     },
-    "65": {
       "content": "[PAD]",
       "lstrip": true,
       "normalized": false,
@@ -16,7 +16,7 @@
       "single_word": false,
       "special": false
     },
-    "66": {
       "content": "<s>",
       "lstrip": false,
       "normalized": false,
@@ -24,7 +24,7 @@
       "single_word": false,
       "special": true
     },
-    "67": {
       "content": "</s>",
       "lstrip": false,
       "normalized": false,

 {
   "added_tokens_decoder": {
+    "50": {
       "content": "[UNK]",
       "lstrip": true,
       "normalized": false,
       "single_word": false,
       "special": false
     },
+    "51": {
       "content": "[PAD]",
       "lstrip": true,
       "normalized": false,
       "single_word": false,
       "special": false
     },
+    "52": {
       "content": "<s>",
       "lstrip": false,
       "normalized": false,
       "single_word": false,
       "special": true
     },
+    "53": {
       "content": "</s>",
       "lstrip": false,
       "normalized": false,

vocab.json CHANGED Viewed

@@ -1,68 +1,54 @@
 {
-  "&": 1,
-  "(": 2,
-  ")": 3,
-  "[PAD]": 65,
-  "[UNK]": 64,
-  "_": 4,
-  "`": 5,
   "|": 0,
-  "·": 6,
-  "ஃ": 7,
-  "அ": 8,
-  "ஆ": 9,
-  "இ": 10,
-  "ஈ": 11,
-  "உ": 12,
-  "ஊ": 13,
-  "எ": 14,
-  "ஏ": 15,
-  "ஐ": 16,
-  "ஒ": 17,
-  "ஓ": 18,
-  "ஔ": 19,
-  "க": 20,
-  "ங": 21,
-  "ச": 22,
-  "ஜ": 23,
-  "ஞ": 24,
-  "ட": 25,
-  "ண": 26,
-  "த": 27,
-  "ந": 28,
-  "ன": 29,
-  "ப": 30,
-  "ம": 31,
-  "ய": 32,
-  "ர": 33,
-  "ற": 34,
-  "ல": 35,
-  "ள": 36,
-  "ழ": 37,
-  "வ": 38,
-  "ஷ": 39,
-  "ஸ": 40,
-  "ஹ": 41,
-  "ா": 42,
-  "ி": 43,
-  "ீ": 44,
-  "ு": 45,
-  "ூ": 46,
-  "ெ": 47,
-  "ே": 48,
-  "ை": 49,
-  "ொ": 50,
-  "ோ": 51,
-  "ௌ": 52,
-  "்": 53,
-  "ௗ": 54,
-  "ഥ": 55,
-  "—": 56,
-  "’": 57,
-  "‚": 58,
-  "•": 59,
-  "…": 60,
-  "′": 61,
-  "″": 62,
-  "◯": 63
 }

 {
+  "[PAD]": 51,
+  "[UNK]": 50,
   "|": 0,
+  "அ": 1,
+  "ஆ": 2,
+  "இ": 3,
+  "ஈ": 4,
+  "உ": 5,
+  "ஊ": 6,
+  "எ": 7,
+  "ஏ": 8,
+  "ஐ": 9,
+  "ஒ": 10,
+  "ஓ": 11,
+  "ஔ": 12,
+  "க": 13,
+  "ங": 14,
+  "ச": 15,
+  "ஜ": 16,
+  "ஞ": 17,
+  "ட": 18,
+  "ண": 19,
+  "த": 20,
+  "ந": 21,
+  "ன": 22,
+  "ப": 23,
+  "ம": 24,
+  "ய": 25,
+  "ர": 26,
+  "ற": 27,
+  "ல": 28,
+  "ள": 29,
+  "ழ": 30,
+  "வ": 31,
+  "ஷ": 32,
+  "ஸ": 33,
+  "ஹ": 34,
+  "ா": 35,
+  "ி": 36,
+  "ீ": 37,
+  "ு": 38,
+  "ூ": 39,
+  "ெ": 40,
+  "ே": 41,
+  "ை": 42,
+  "ொ": 43,
+  "ோ": 44,
+  "ௌ": 45,
+  "்": 46,
+  "ௗ": 47,
+  "ഥ": 48,
+  "◯": 49
 }