Add files using upload-large-folder tool

Browse files

Files changed (11) hide show

.gitattributes +1 -0
README.md +37 -0
config.json +1249 -0
generation_config.json +11 -0
model-00001-of-00003.safetensors +3 -0
model-00002-of-00003.safetensors +3 -0
model-00003-of-00003.safetensors +3 -0
model.safetensors.index.json +783 -0
special_tokens_map.json +23 -0
tokenizer.json +3 -0
tokenizer_config.json +184 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text

README.md ADDED Viewed

	@@ -0,0 +1,37 @@

+---
+license: apache-2.0
+pipeline_tag: text-generation
+library_name: mlx
+tags:
+- vllm
+- mlx
+base_model: openai/gpt-oss-20b
+---
+# mlx-community/gpt-oss-20b-MXFP4-Q4
+This model [mlx-community/gpt-oss-20b-MXFP4-Q4](https://huggingface.co/mlx-community/gpt-oss-20b-MXFP4-Q4) was
+converted to MLX format from [openai/gpt-oss-20b](https://huggingface.co/openai/gpt-oss-20b)
+using mlx-lm version **0.27.0**.
+## Use with mlx
+```bash
+pip install mlx-lm
+```
+```python
+from mlx_lm import load, generate
+model, tokenizer = load("mlx-community/gpt-oss-20b-MXFP4-Q4")
+prompt = "hello"
+if tokenizer.chat_template is not None:
+    messages = [{"role": "user", "content": prompt}]
+    prompt = tokenizer.apply_chat_template(
+        messages, add_generation_prompt=True
+    )
+response = generate(model, tokenizer, prompt=prompt, verbose=True)
+```

config.json ADDED Viewed

	@@ -0,0 +1,1249 @@

+{
+    "architectures": [
+        "GptOssForCausalLM"
+    ],
+    "attention_bias": true,
+    "attention_dropout": 0.0,
+    "eos_token_id": 200002,
+    "experts_per_token": 4,
+    "head_dim": 64,
+    "hidden_act": "silu",
+    "hidden_size": 2880,
+    "initial_context_length": 4096,
+    "initializer_range": 0.02,
+    "intermediate_size": 2880,
+    "layer_types": [
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention",
+        "sliding_attention",
+        "full_attention"
+    ],
+    "max_position_embeddings": 131072,
+    "model_type": "gpt_oss",
+    "num_attention_heads": 64,
+    "num_experts_per_tok": 4,
+    "num_hidden_layers": 24,
+    "num_key_value_heads": 8,
+    "num_local_experts": 32,
+    "output_router_logits": false,
+    "pad_token_id": 199999,
+    "quantization": {
+        "group_size": 32,
+        "bits": 4,
+        "mode": "mxfp4",
+        "model.embed_tokens": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.1.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.1.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.1.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.1.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.1.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.2.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.2.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.2.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.2.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.2.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.3.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.3.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.3.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.3.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.3.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.4.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.4.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.4.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.4.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.4.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.5.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.5.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.5.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.5.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.5.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.6.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.6.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.6.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.6.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.6.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.7.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.7.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.7.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.7.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.7.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.8.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.8.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.8.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.8.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.8.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.9.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.9.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.9.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.9.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.9.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.10.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.10.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.10.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.10.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.10.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.11.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.11.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.11.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.11.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.11.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.12.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.12.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.12.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.12.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.12.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.13.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.13.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.13.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.13.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.13.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.14.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.14.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.14.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.14.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.14.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.15.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.15.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.15.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.15.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.15.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.16.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.16.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.16.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.16.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.16.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.17.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.17.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.17.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.17.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.17.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.18.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.18.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.18.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.18.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.18.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.19.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.19.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.19.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.19.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.19.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.20.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.20.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.20.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.20.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.20.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.21.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.21.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.21.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.21.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.21.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.22.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.22.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.22.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.22.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.22.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.23.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.23.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.23.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.23.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.23.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "lm_head": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        }
+    },
+    "quantization_config": {
+        "group_size": 32,
+        "bits": 4,
+        "mode": "mxfp4",
+        "model.embed_tokens": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.0.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.1.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.1.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.1.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.1.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.1.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.2.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.2.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.2.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.2.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.2.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.3.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.3.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.3.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.3.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.3.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.4.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.4.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.4.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.4.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.4.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.5.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.5.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.5.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.5.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.5.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.6.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.6.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.6.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.6.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.6.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.7.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.7.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.7.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.7.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.7.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.8.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.8.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.8.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.8.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.8.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.9.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.9.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.9.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.9.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.9.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.10.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.10.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.10.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.10.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.10.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.11.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.11.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.11.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.11.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.11.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.12.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.12.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.12.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.12.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.12.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.13.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.13.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.13.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.13.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.13.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.14.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.14.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.14.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.14.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.14.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.15.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.15.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.15.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.15.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.15.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.16.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.16.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.16.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.16.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.16.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.17.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.17.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.17.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.17.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.17.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.18.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.18.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.18.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.18.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.18.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.19.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.19.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.19.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.19.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.19.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.20.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.20.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.20.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.20.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.20.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.21.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.21.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.21.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.21.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.21.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.22.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.22.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.22.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.22.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.22.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "model.layers.23.self_attn.q_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.23.self_attn.k_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.23.self_attn.v_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.23.self_attn.o_proj": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        },
+        "model.layers.23.mlp.router": {
+            "group_size": 64,
+            "bits": 8
+        },
+        "lm_head": {
+            "group_size": 64,
+            "bits": 4,
+            "mode": "affine"
+        }
+    },
+    "rms_norm_eps": 1e-05,
+    "rope_scaling": {
+        "beta_fast": 32.0,
+        "beta_slow": 1.0,
+        "factor": 32.0,
+        "original_max_position_embeddings": 4096,
+        "rope_type": "yarn",
+        "truncate": false
+    },
+    "rope_theta": 150000,
+    "router_aux_loss_coef": 0.9,
+    "sliding_window": 128,
+    "swiglu_limit": 7.0,
+    "tie_word_embeddings": false,
+    "transformers_version": "4.55.0.dev0",
+    "use_cache": true,
+    "vocab_size": 201088
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,11 @@

+{
+  "bos_token_id": 199998,
+  "do_sample": true,
+  "eos_token_id": [
+    200002,
+    199999,
+    200012
+  ],
+  "pad_token_id": 199999,
+  "transformers_version": "4.55.0.dev0"
+}

model-00001-of-00003.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:ec8571f6f8adba2d7d92a1f6029a69aecd18ab4e82404a306ceb063d9ae1362d
+size 5306798277

model-00002-of-00003.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:9a32623d891d6f64694fdaaaeecf145d8796d17c238b9b99af953077d0f63837
+size 5263518916

model-00003-of-00003.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3fb80743340b3dbeb649e50b5fd1b5f063e98c143759025284344988d8fa0a95
+size 608251966

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,783 @@

+{
+    "metadata": {
+        "total_size": 11178480768,
+        "total_parameters": 20914755648
+    },
+    "weight_map": {
+        "lm_head.biases": "model-00003-of-00003.safetensors",
+        "lm_head.scales": "model-00003-of-00003.safetensors",
+        "lm_head.weight": "model-00003-of-00003.safetensors",
+        "model.embed_tokens.biases": "model-00001-of-00003.safetensors",
+        "model.embed_tokens.scales": "model-00001-of-00003.safetensors",
+        "model.embed_tokens.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.0.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.1.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.10.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.10.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.11.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.11.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.11.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.11.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.11.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.12.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.13.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.14.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.15.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.16.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.17.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.18.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.19.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.2.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.20.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.21.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.21.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.experts.down_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.experts.down_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.experts.down_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.experts.up_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.experts.up_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.experts.up_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.router.bias": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.router.biases": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.router.scales": "model-00002-of-00003.safetensors",
+        "model.layers.22.mlp.router.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.22.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.23.input_layernorm.weight": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.experts.down_proj.bias": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.experts.down_proj.scales": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.experts.down_proj.weight": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.experts.gate_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.23.mlp.experts.gate_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.23.mlp.experts.gate_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.23.mlp.experts.up_proj.bias": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.experts.up_proj.scales": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.experts.up_proj.weight": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.router.bias": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.router.biases": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.router.scales": "model-00003-of-00003.safetensors",
+        "model.layers.23.mlp.router.weight": "model-00003-of-00003.safetensors",
+        "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+        "model.layers.23.self_attn.k_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.o_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.q_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.sinks": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.v_proj.bias": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+        "model.layers.23.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+        "model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.3.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.4.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.5.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.6.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.7.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.8.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.input_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.experts.down_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.experts.down_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.experts.down_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.experts.gate_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.experts.gate_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.experts.gate_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.experts.up_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.experts.up_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.experts.up_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.router.bias": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.router.biases": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.router.scales": "model-00001-of-00003.safetensors",
+        "model.layers.9.mlp.router.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.k_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.o_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.q_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.sinks": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.v_proj.bias": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+        "model.layers.9.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+        "model.norm.weight": "model-00001-of-00003.safetensors"
+    }
+}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,23 @@

+{
+  "bos_token": {
+    "content": "<|startoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|return|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0614fe83cadab421296e664e1f48f4261fa8fef6e03e63bb75c20f38e37d07d3
+size 27868174

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,184 @@

+{
+  "added_tokens_decoder": {
+    "199998": {
+      "content": "<|startoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "199999": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200000": {
+      "content": "<|reserved_200000|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200001": {
+      "content": "<|reserved_200001|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200002": {
+      "content": "<|return|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200003": {
+      "content": "<|constrain|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200004": {
+      "content": "<|reserved_200004|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200005": {
+      "content": "<|channel|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200006": {
+      "content": "<|start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200007": {
+      "content": "<|end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200008": {
+      "content": "<|message|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200009": {
+      "content": "<|reserved_200009|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200010": {
+      "content": "<|reserved_200010|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200011": {
+      "content": "<|reserved_200011|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200012": {
+      "content": "<|call|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200013": {
+      "content": "<|reserved_200013|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200014": {
+      "content": "<|reserved_200014|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200015": {
+      "content": "<|reserved_200015|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200016": {
+      "content": "<|reserved_200016|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200017": {
+      "content": "<|reserved_200017|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "200018": {
+      "content": "<|endofprompt|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "bos_token": "<|startoftext|>",
+  "chat_template": "{#-\n  In addition to the normal inputs of `messages` and `tools`, this template also accepts the\n  following kwargs:\n  - \"builtin_tools\": A list, can contain \"browser\" and/or \"python\".\n  - \"model_identity\": A string that optionally describes the model identity.\n  - \"reasoning_effort\": A string that describes the reasoning effort, defaults to \"medium\".\n #}\n\n{#- Tool Definition Rendering ============================================== #}\n{%- macro render_typescript_type(param_spec, required_params, is_nullable=false) -%}\n    {%- if param_spec.type == \"array\" -%}\n        {%- if param_spec['items'] -%}\n            {%- if param_spec['items']['type'] == \"string\" -%}\n                {{- \"string[]\" }}\n            {%- elif param_spec['items']['type'] == \"number\" -%}\n                {{- \"number[]\" }}\n            {%- elif param_spec['items']['type'] == \"integer\" -%}\n                {{- \"number[]\" }}\n            {%- elif param_spec['items']['type'] == \"boolean\" -%}\n                {{- \"boolean[]\" }}\n            {%- else -%}\n                {%- set inner_type = render_typescript_type(param_spec['items'], required_params) -%}\n                {%- if inner_type == \"object | object\" or inner_type|length > 50 -%}\n                    {{- \"any[]\" }}\n                {%- else -%}\n                    {{- inner_type + \"[]\" }}\n                {%- endif -%}\n            {%- endif -%}\n            {%- if param_spec.nullable -%}\n                {{- \" | null\" }}\n            {%- endif -%}\n        {%- else -%}\n            {{- \"any[]\" }}\n            {%- if param_spec.nullable -%}\n                {{- \" | null\" }}\n            {%- endif -%}\n        {%- endif -%}\n    {%- elif param_spec.type is defined and param_spec.type is iterable and param_spec.type is not string and param_spec.type is not mapping and param_spec.type[0] is defined -%}\n        {#- Handle array of types like [\"object\", \"object\"] from Union[dict, list] #}\n        {%- if param_spec.type | length > 1 -%}\n            {{- param_spec.type | join(\" | \") }}\n        {%- else -%}\n            {{- param_spec.type[0] }}\n        {%- endif -%}\n    {%- elif param_spec.oneOf -%}\n        {#- Handle oneOf schemas - check for complex unions and fallback to any #}\n        {%- set has_object_variants = false -%}\n        {%- for variant in param_spec.oneOf -%}\n            {%- if variant.type == \"object\" -%}\n                {%- set has_object_variants = true -%}\n            {%- endif -%}\n        {%- endfor -%}\n        {%- if has_object_variants and param_spec.oneOf|length > 1 -%}\n            {{- \"any\" }}\n        {%- else -%}\n            {%- for variant in param_spec.oneOf -%}\n                {{- render_typescript_type(variant, required_params) -}}\n                {%- if variant.description %}\n                    {{- \"// \" + variant.description }}\n                {%- endif -%}\n                {%- if variant.default is defined %}\n                    {{ \"// default: \" + variant.default|tojson }}\n                {%- endif -%}\n                {%- if not loop.last %}\n                    {{- \" | \" }}\n                {% endif -%}\n            {%- endfor -%}\n        {%- endif -%}\n    {%- elif param_spec.type == \"string\" -%}\n        {%- if param_spec.enum -%}\n            {{- '\"' + param_spec.enum|join('\" | \"') + '\"' -}}\n        {%- else -%}\n            {{- \"string\" }}\n            {%- if param_spec.nullable %}\n                {{- \" | null\" }}\n            {%- endif -%}\n        {%- endif -%}\n    {%- elif param_spec.type == \"number\" -%}\n        {{- \"number\" }}\n    {%- elif param_spec.type == \"integer\" -%}\n        {{- \"number\" }}\n    {%- elif param_spec.type == \"boolean\" -%}\n        {{- \"boolean\" }}\n\n    {%- elif param_spec.type == \"object\" -%}\n        {%- if param_spec.properties -%}\n            {{- \"{\\n\" }}\n            {%- for prop_name, prop_spec in param_spec.properties.items() -%}\n                {{- prop_name -}}\n                {%- if prop_name not in (param_spec.required or []) -%}\n                    {{- \"?\" }}\n                {%- endif -%}\n                {{- \": \" }}\n                {{ render_typescript_type(prop_spec, param_spec.required or []) }}\n                {%- if not loop.last -%}\n                    {{-\", \" }}\n                {%- endif -%}\n            {%- endfor -%}\n            {{- \"}\" }}\n        {%- else -%}\n            {{- \"object\" }}\n        {%- endif -%}\n    {%- else -%}\n        {{- \"any\" }}\n    {%- endif -%}\n{%- endmacro -%}\n\n{%- macro render_tool_namespace(namespace_name, tools) -%}\n    {{- \"## \" + namespace_name + \"\\n\\n\" }}\n    {{- \"namespace \" + namespace_name + \" {\\n\\n\" }}\n    {%- for tool in tools %}\n        {%- set tool = tool.function %}\n        {{- \"// \" + tool.description + \"\\n\" }}\n        {{- \"type \"+ tool.name + \" = \" }}\n        {%- if tool.parameters and tool.parameters.properties %}\n            {{- \"(_: {\\n\" }}\n            {%- for param_name, param_spec in tool.parameters.properties.items() %}\n                {%- if param_spec.description %}\n                    {{- \"// \" + param_spec.description + \"\\n\" }}\n                {%- endif %}\n                {{- param_name }}\n                {%- if param_name not in (tool.parameters.required or []) -%}\n                    {{- \"?\" }}\n                {%- endif -%}\n                {{- \": \" }}\n                {{- render_typescript_type(param_spec, tool.parameters.required or []) }}\n                {%- if param_spec.default is defined -%}\n                    {%- if param_spec.enum %}\n                        {{- \", // default: \" + param_spec.default }}\n                    {%- elif param_spec.oneOf %}\n                        {{- \"// default: \" + param_spec.default }}\n                    {%- else %}\n                        {{- \", // default: \" + param_spec.default|tojson }}\n                    {%- endif -%}\n                {%- endif -%}\n                {%- if not loop.last %}\n                    {{- \",\\n\" }}\n                {%- else %}\n                    {{- \",\\n\" }}\n                {%- endif -%}\n            {%- endfor %}\n            {{- \"}) => any;\\n\\n\" }}\n        {%- else -%}\n            {{- \"() => any;\\n\\n\" }}\n        {%- endif -%}\n    {%- endfor %}\n    {{- \"} // namespace \" + namespace_name }}\n{%- endmacro -%}\n\n{%- macro render_builtin_tools(browser_tool, python_tool) -%}\n    {%- if browser_tool %}\n        {{- \"## browser\\n\\n\" }}\n        {{- \"// Tool for browsing.\\n\" }}\n        {{- \"// The `cursor` appears in brackets before each browsing display: `[{cursor}]`.\\n\" }}\n        {{- \"// Cite information from the tool using the following format:\\n\" }}\n        {{- \"// `【{cursor}†L{line_start}(-L{line_end})?】`, for example: `【6†L9-L11】` or `【8†L3】`.\\n\" }}\n        {{- \"// Do not quote more than 10 words directly from the tool output.\\n\" }}\n        {{- \"// sources=web (default: web)\\n\" }}\n        {{- \"namespace browser {\\n\\n\" }}\n        {{- \"// Searches for information related to `query` and displays `topn` results.\\n\" }}\n        {{- \"type search = (_: {\\n\" }}\n        {{- \"query: string,\\n\" }}\n        {{- \"topn?: number, // default: 10\\n\" }}\n        {{- \"source?: string,\\n\" }}\n        {{- \"}) => any;\\n\\n\" }}\n        {{- \"// Opens the link `id` from the page indicated by `cursor` starting at line number `loc`, showing `num_lines` lines.\\n\" }}\n        {{- \"// Valid link ids are displayed with the formatting: `【{id}†.*】`.\\n\" }}\n        {{- \"// If `cursor` is not provided, the most recent page is implied.\\n\" }}\n        {{- \"// If `id` is a string, it is treated as a fully qualified URL associated with `source`.\\n\" }}\n        {{- \"// If `loc` is not provided, the viewport will be positioned at the beginning of the document or centered on the most relevant passage, if available.\\n\" }}\n        {{- \"// Use this function without `id` to scroll to a new location of an opened page.\\n\" }}\n        {{- \"type open = (_: {\\n\" }}\n        {{- \"id?: number | string, // default: -1\\n\" }}\n        {{- \"cursor?: number, // default: -1\\n\" }}\n        {{- \"loc?: number, // default: -1\\n\" }}\n        {{- \"num_lines?: number, // default: -1\\n\" }}\n        {{- \"view_source?: boolean, // default: false\\n\" }}\n        {{- \"source?: string,\\n\" }}\n        {{- \"}) => any;\\n\\n\" }}\n        {{- \"// Finds exact matches of `pattern` in the current page, or the page given by `cursor`.\\n\" }}\n        {{- \"type find = (_: {\\n\" }}\n        {{- \"pattern: string,\\n\" }}\n        {{- \"cursor?: number, // default: -1\\n\" }}\n        {{- \"}) => any;\\n\\n\" }}\n        {{- \"} // namespace browser\\n\\n\" }}\n    {%- endif -%}\n\n    {%- if python_tool %}\n        {{- \"## python\\n\\n\" }}\n        {{- \"Use this tool to execute Python code in your chain of thought. The code will not be shown to the user. This tool should be used for internal reasoning, but not for code that is intended to be visible to the user (e.g. when creating plots, tables, or files).\\n\\n\" }}\n        {{- \"When you send a message containing Python code to python, it will be executed in a stateful Jupyter notebook environment. python will respond with the output of the execution or time out after 120.0 seconds. The drive at '/mnt/data' can be used to save and persist user files. Internet access for this session is UNKNOWN. Depends on the cluster.\\n\\n\" }}\n    {%- endif -%}\n{%- endmacro -%}\n\n{#- System Message Construction ============================================ #}\n{%- macro build_system_message() -%}\n    {%- if model_identity is not defined %}\n        {%- set model_identity = \"You are ChatGPT, a large language model trained by OpenAI.\" %}\n    {%- endif %}\n    {{- model_identity + \"\\n\" }}\n    {{- \"Knowledge cutoff: 2024-06\\n\" }}\n    {{- \"Current date: \" + strftime_now(\"%Y-%m-%d\") + \"\\n\\n\" }}\n    {%- if reasoning_effort is not defined %}\n        {%- set reasoning_effort = \"medium\" %}\n    {%- endif %}\n    {{- \"Reasoning: \" + reasoning_effort + \"\\n\\n\" }}\n    {%- if builtin_tools %}\n        {{- \"# Tools\\n\\n\" }}\n        {%- set available_builtin_tools = namespace(browser=false, python=false) %}\n        {%- for tool in builtin_tools %}\n            {%- if tool == \"browser\" %}\n                {%- set available_builtin_tools.browser = true %}\n            {%- elif tool == \"python\" %}\n                {%- set available_builtin_tools.python = true %}\n            {%- endif %}\n        {%- endfor %}\n        {{- render_builtin_tools(available_builtin_tools.browser, available_builtin_tools.python) }}\n    {%- endif -%}\n    {{- \"# Valid channels: analysis, commentary, final. Channel must be included for every message.\" }}\n    {%- if tools -%}\n        {{- \"\\nCalls to these tools must go to the commentary channel: 'functions'.\" }}\n    {%- endif -%}\n{%- endmacro -%}\n\n{#- Main Template Logic ================================================= #}\n{#- Set defaults #}\n\n{#- Render system message #}\n{{- \"<|start|>system<|message|>\" }}\n{{- build_system_message() }}\n{{- \"<|end|>\" }}\n\n{#- Extract developer message #}\n{%- if messages[0].role == \"developer\" or messages[0].role == \"system\" %}\n    {%- set developer_message = messages[0].content %}\n    {%- set loop_messages = messages[1:] %}\n{%- else %}\n    {%- set developer_message = \"\" %}\n    {%- set loop_messages = messages %}\n{%- endif %}\n\n{#- Render developer message #}\n{%- if developer_message or tools %}\n    {{- \"<|start|>developer<|message|>\" }}\n    {%- if developer_message %}\n        {{- \"# Instructions\\n\\n\" }}\n        {{- developer_message }}\n        {{- \"\\n\\n\" }}\n    {%- endif %}\n    {%- if tools -%}\n        {{- \"# Tools\\n\\n\" }}\n        {{- render_tool_namespace(\"functions\", tools) }}\n    {%- endif -%}\n    {{- \"<|end|>\" }}\n{%- endif %}\n\n{#- Render messages #}\n{%- set last_tool_call = namespace(name=none) %}\n{%- for message in loop_messages -%}\n    {#- At this point only assistant/user/tool messages should remain #}\n    {%- if message.role == 'assistant' -%}\n        {#- Checks to ensure the messages are being passed in the format we expect #}\n        {%- if \"content\" in message %}\n            {%- if \"<|channel|>analysis<|message|>\" in message.content or \"<|channel|>final<|message|>\" in message.content %}\n                {{- raise_exception(\"You have passed a message containing <|channel|> tags in the content field. Instead of doing this, you should pass analysis messages (the string between '<|message|>' and '<|end|>') in the 'thinking' field, and final messages (the string between '<|message|>' and '<|end|>') in the 'content' field.\") }}\n            {%- endif %}\n        {%- endif %}\n        {%- if \"thinking\" in message %}\n            {%- if \"<|channel|>analysis<|message|>\" in message.thinking or \"<|channel|>final<|message|>\" in message.thinking %}\n                {{- raise_exception(\"You have passed a message containing <|channel|> tags in the thinking field. Instead of doing this, you should pass analysis messages (the string between '<|message|>' and '<|end|>') in the 'thinking' field, and final messages (the string between '<|message|>' and '<|end|>') in the 'content' field.\") }}\n            {%- endif %}\n        {%- endif %}\n        {%- if \"tool_calls\" in message %}\n            {#- We need very careful handling here - we want to drop the tool call analysis message if the model #}\n            {#- has output a later <|final|> message, but otherwise we want to retain it. This is the only case #}\n            {#- when we render CoT/analysis messages in inference. #}\n            {%- set future_final_message = namespace(found=false) %}\n            {%- for future_message in loop_messages[loop.index:] %}\n                {%- if future_message.role == 'assistant' and \"tool_calls\" not in future_message %}\n                    {%- set future_final_message.found = true %}\n                {%- endif %}\n            {%- endfor %}\n            {#- We assume max 1 tool call per message, and so we infer the tool call name #}\n            {#- in \"tool\" messages from the most recent assistant tool call name #}\n            {%- set tool_call = message.tool_calls[0] %}\n            {%- if tool_call.function %}\n                {%- set tool_call = tool_call.function %}\n            {%- endif %}\n            {%- if message.content and message.thinking %}\n                {{- raise_exception(\"Cannot pass both content and thinking in an assistant message with tool calls! Put the analysis message in one or the other, but not both.\") }}\n            {%- elif message.content and not future_final_message.found %}\n                {{- \"<|start|>assistant<|channel|>analysis<|message|>\" + message.content + \"<|end|>\" }}\n            {%- elif message.thinking and not future_final_message.found %}\n                {{- \"<|start|>assistant<|channel|>analysis<|message|>\" + message.thinking + \"<|end|>\" }}\n            {%- endif %}\n            {{- \"<|start|>assistant to=\" }}\n            {{- \"functions.\" + tool_call.name + \"<|channel|>commentary \" }}\n            {{- (tool_call.content_type if tool_call.content_type is defined else \"json\") + \"<|message|>\" }}\n            {{- tool_call.arguments|tojson }}\n            {{- \"<|call|>\" }}\n            {%- set last_tool_call.name = tool_call.name %}\n        {%- elif loop.last and not add_generation_prompt %}\n            {#- Only render the CoT if the final turn is an assistant turn and add_generation_prompt is false #}\n            {#- This is a situation that should only occur in training, never in inference. #}\n            {%- if \"thinking\" in message %}\n                {{- \"<|start|>assistant<|channel|>analysis<|message|>\" + message.thinking + \"<|end|>\" }}\n            {%- endif %}\n            {#- <|return|> indicates the end of generation, but <|end|> does not #}\n            {#- <|return|> should never be an input to the model, but we include it as the final token #}\n            {#- when training, so the model learns to emit it. #}\n            {{- \"<|start|>assistant<|channel|>final<|message|>\" + message.content + \"<|return|>\" }}\n        {%- else %}\n            {#- CoT is dropped during all previous turns, so we never render it for inference #}\n            {{- \"<|start|>assistant<|channel|>final<|message|>\" + message.content + \"<|end|>\" }}\n            {%- set last_tool_call.name = none %}\n        {%- endif %}\n    {%- elif message.role == 'tool' -%}\n        {%- if last_tool_call.name is none %}\n            {{- raise_exception(\"Message has tool role, but there was no previous assistant message with a tool call!\") }}\n        {%- endif %}\n        {{- \"<|start|>functions.\" + last_tool_call.name }}\n        {{- \" to=assistant<|channel|>commentary<|message|>\" + message.content|tojson + \"<|end|>\" }}\n    {%- elif message.role == 'user' -%}\n        {{- \"<|start|>user<|message|>\" + message.content + \"<|end|>\" }}\n    {%- endif -%}\n{%- endfor -%}\n\n{#- Generation prompt #}\n{%- if add_generation_prompt -%}\n<|start|>assistant\n{%- endif -%}",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|return|>",
+  "extra_special_tokens": {},
+  "model_input_names": [
+    "input_ids",
+    "attention_mask"
+  ],
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": "<|endoftext|>",
+  "tokenizer_class": "PreTrainedTokenizer"
+}