Upload folder using huggingface_hub

Files changed (3) hide show

README.md ADDED Viewed

+---
+library_name: transformers
+tags:
+- transformers.js
+- tokenizers
+license: mit
+---
+Cloned from [Xenova/claude-tokenizer](https://huggingface.co/Xenova/claude-tokenizer)
+# Claude Tokenizer
+A 🤗-compatible version of the **Claude tokenizer** (adapted from [anthropics/anthropic-sdk-python](https://github.com/anthropics/anthropic-sdk-python)). This means it can be used with Hugging Face libraries including [Transformers](https://github.com/huggingface/transformers), [Tokenizers](https://github.com/huggingface/tokenizers), and [Transformers.js](https://github.com/xenova/transformers.js).
+## Example usage:
+### Transformers/Tokenizers
+```py
+from transformers import GPT2TokenizerFast
+tokenizer = GPT2TokenizerFast.from_pretrained('Xenova/claude-tokenizer')
+assert tokenizer.encode('hello world') == [9381, 2253]
+```
+### Transformers.js
+```js
+import { AutoTokenizer } from '@xenova/transformers';
+const tokenizer = await AutoTokenizer.from_pretrained('Xenova/claude-tokenizer');
+const tokens = tokenizer.encode('hello world'); // [9381, 2253]
+```

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

+{
+  "add_prefix_space": false,
+  "bos_token": "<EOT>",
+  "clean_up_tokenization_spaces": true,
+  "eos_token": "<EOT>",
+  "model_max_length": 200000,
+  "tokenizer_class": "GPT2TokenizerFast",
+  "unk_token": "<EOT>"
+}