Upload folder using huggingface_hub

Browse files

Files changed (15) hide show

README.md +100 -3
__init__.py +0 -0
added_tokens.json +3 -0
config.json +73 -0
configuration_rwkv7.py +107 -0
generation_config.json +9 -0
hf_rwkv_tokenizer.py +280 -0
model-00001-of-00003.safetensors +3 -0
model-00002-of-00003.safetensors +3 -0
model-00003-of-00003.safetensors +3 -0
model.safetensors.index.json +1067 -0
modeling_rwkv7.py +4 -0
rwkv_vocab_v20230424.txt +0 -0
special_tokens_map.json +24 -0
tokenizer_config.json +28 -0

README.md CHANGED Viewed

@@ -1,3 +1,100 @@
----
-license: apache-2.0
----

+---
+license: apache-2.0
+language:
+- en
+- zh
+- ja
+- ko
+- fr
+- ar
+- es
+- pt
+metrics:
+- accuracy
+base_model:
+- BlinkDL/rwkv7-g1
+pipeline_tag: text-generation
+---
+# rwkv7-7.2B-g0
+<!-- Provide a quick summary of what the model is/does. -->
+This is RWKV-7 model under flash-linear attention format.
+## Model Details
+### Model Description
+<!-- Provide a longer summary of what this model is. -->
+- **Developed by:** Bo Peng, Yu Zhang, Songlin Yang, Ruichong Zhang, Zhiyuan Li
+- **Funded by:** RWKV Project (Under LF AI & Data Foundation)
+- **Model type:** RWKV7
+- **Language(s) (NLP):** Multilingual
+- **License:** Apache-2.0
+- **Parameter count:** 7.2B
+- **Tokenizer:** RWKV World tokenizer
+- **Vocabulary size:** 65,536
+### Model Sources
+<!-- Provide the basic links for the model. -->
+- **Repository:** https://github.com/fla-org/flash-linear-attention ; https://github.com/BlinkDL/RWKV-LM
+- **Paper:** https://arxiv.org/abs/2503.14456
+- **Model:** https://huggingface.co/BlinkDL/rwkv7-g1/resolve/main/rwkv7-g1-2.9b-20250519-ctx4096.pth
+## Uses
+<!-- Address questions around how the model is intended to be used, including the foreseeable users of the model and those affected by the model. -->
+Install `flash-linear-attention` and the latest version of `transformers` before using this model:
+```bash
+pip install git+https://github.com/fla-org/flash-linear-attention
+pip install 'transformers>=4.48.0'
+```
+### Direct Use
+<!-- This section is for the model use without fine-tuning or plugging into a larger ecosystem/app. -->
+You can use this model just as any other HuggingFace models:
+```python
+from transformers import AutoModelForCausalLM, AutoTokenizer
+model = AutoModelForCausalLM.from_pretrained('fla-hub/rwkv7-7.2B-g0', trust_remote_code=True)
+tokenizer = AutoTokenizer.from_pretrained('fla-hub/rwkv7-7.2B-g0', trust_remote_code=True)
+model = model.cuda() # Supported on Nvidia/AMD/Intel eg. model.xpu()
+prompt = "What is a large language model?"
+messages = [
+    {"role": "user", "content": prompt}
+]
+text = tokenizer.apply_chat_template(
+    messages,
+    tokenize=False,
+    add_generation_prompt=True,
+    enable_thinking=True  # Default is True, set to False to disable thinking
+)
+model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
+generated_ids = model.generate(
+    **model_inputs,
+    max_new_tokens=1024,
+    do_sample=True,
+    temperature=1.0,
+    top_p=0.3,
+    repetition_penalty=1.2
+)
+generated_ids = [
+    output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
+]
+response = tokenizer.batch_decode(generated_ids, skip_special_tokens=False)[0]
+print(response)
+```
+## FAQ
+Q: safetensors metadata is none.
+A: upgrade transformers to >=4.48.0: `pip install 'transformers>=4.48.0'`

__init__.py ADDED Viewed

File without changes

added_tokens.json ADDED Viewed

	@@ -0,0 +1,3 @@

+{
+  "<|rwkv_tokenizer_end_of_text|>": 0
+}

config.json ADDED Viewed

	@@ -0,0 +1,73 @@

+{
+  "a_low_rank_dim": 128,
+  "architectures": [
+    "RWKV7ForCausalLM"
+  ],
+  "attn": null,
+  "attn_mode": "chunk",
+  "auto_map": {
+    "AutoConfig": "configuration_rwkv7.RWKV7Config",
+    "AutoModel": "modeling_rwkv7.RWKV7Model",
+    "AutoModelForCausalLM": "modeling_rwkv7.RWKV7ForCausalLM"
+  },
+  "bos_token_id": 1,
+  "decay_low_rank_dim": 128,
+  "eos_token_id": 2,
+  "fuse_cross_entropy": true,
+  "fuse_norm": true,
+  "gate_low_rank_dim": 480,
+  "head_dim": 64,
+  "hidden_act": "sqrelu",
+  "hidden_ratio": 4.0,
+  "hidden_size": 4096,
+  "initializer_range": 0.02,
+  "intermediate_size": 16384,
+  "max_position_embeddings": 2048,
+  "model_type": "rwkv7",
+  "norm_bias": true,
+  "norm_eps": 1e-05,
+  "norm_first": true,
+  "num_heads": 32,
+  "num_hidden_layers": 32,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.53.0",
+  "use_cache": true,
+  "use_l2warp": true,
+  "v_low_rank_dim": 96,
+  "value_dim": [
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096,
+    4096
+  ],
+  "vocab_size": 65536
+}

configuration_rwkv7.py ADDED Viewed

	@@ -0,0 +1,107 @@

+# -*- coding: utf-8 -*-
+from typing import Dict, List, Optional, Union
+from transformers.configuration_utils import PretrainedConfig
+class RWKV7Config(PretrainedConfig):
+    model_type = 'rwkv7'
+    keys_to_ignore_at_inference = ['past_key_values']
+    def __init__(
+        self,
+        attn_mode: str = "chunk",
+        hidden_size: int = 2048,
+        hidden_ratio: Optional[int] = 4,
+        intermediate_size: Optional[int] = None,
+        num_hidden_layers: int = 24,
+        head_dim: Optional[int] = 64,
+        num_heads: Optional[int] = None,
+        decay_low_rank_dim: int = 64,
+        gate_low_rank_dim: int = 128,
+        a_low_rank_dim: int = 64,
+        v_low_rank_dim: int = 16,
+        hidden_act: str = "sqrelu",
+        max_position_embeddings: int = 2048,
+        norm_first: bool = True,
+        norm_bias: bool = True,
+        norm_eps: float = 1e-5,
+        attn: Optional[Dict] = None,
+        use_cache: bool = True,
+        pad_token_id: Optional[int] = None,
+        bos_token_id: int = 1,
+        eos_token_id: int = 2,
+        tie_word_embeddings: bool = False,
+        initializer_range: float = 0.02,
+        fuse_norm: bool = True,
+        fuse_cross_entropy: bool = True,
+        use_l2warp: bool = True,
+        vocab_size: int = 32000,
+        value_dim: Optional[Union[int, List[int]]] = None,
+        **kwargs
+    ):
+        self.attn_mode = attn_mode
+        self.hidden_size = hidden_size
+        self.hidden_ratio = hidden_ratio
+        self.intermediate_size = intermediate_size
+        self.norm_first = norm_first
+        self.num_hidden_layers = num_hidden_layers
+        if head_dim is None and num_heads is not None:
+            head_dim = int(hidden_size // num_heads)
+        elif head_dim is not None and num_heads is None:
+            num_heads = int(hidden_size // head_dim)
+        if value_dim is None:
+            value_dim = [hidden_size] * num_hidden_layers
+        elif isinstance(value_dim, int):
+            assert value_dim >= hidden_size, "value_dim must be greater than hidden_size"
+            assert value_dim % hidden_size == 0, "value_dim must be divisible by hidden_size"
+            value_dim = [value_dim] * num_hidden_layers
+        else:
+            assert len(value_dim) == num_hidden_layers, "value_dim must have the same length as num_hidden_layers"
+            for v in value_dim:
+                assert v >= hidden_size, "value_dim must be greater than hidden_size"
+                assert v % hidden_size == 0, "value_dim must be divisible by hidden_size"
+        self.head_dim = head_dim
+        self.num_heads = num_heads
+        self.value_dim = value_dim
+        self.decay_low_rank_dim = decay_low_rank_dim
+        self.gate_low_rank_dim = gate_low_rank_dim
+        self.a_low_rank_dim = a_low_rank_dim
+        self.v_low_rank_dim = v_low_rank_dim
+        self.hidden_act = hidden_act
+        self.max_position_embeddings = max_position_embeddings
+        self.norm_bias = norm_bias
+        self.norm_eps = norm_eps
+        self.attn = attn
+        self.use_cache = use_cache
+        self.initializer_range = initializer_range
+        self.fuse_norm = fuse_norm
+        self.fuse_cross_entropy = fuse_cross_entropy
+        self.use_l2warp = use_l2warp
+        self.vocab_size = vocab_size
+        if attn is not None:
+            if not isinstance(attn, Dict):
+                raise ValueError("attn must be a dictionary")
+            if 'layers' not in attn:
+                raise ValueError("Layer indices must be provided to initialize hybrid attention layers")
+            if 'num_heads' not in attn:
+                raise ValueError("Number of heads must be provided to initialize hybrid attention layers")
+            attn['num_kv_heads'] = attn.get('num_kv_heads', attn['num_heads'])
+            attn['qkv_bias'] = attn.get('qkv_bias', False)
+            attn['window_size'] = attn.get('window_size', None)
+            attn['rope_theta'] = attn.get('rope_theta', 10000.)
+        super().__init__(
+            pad_token_id=pad_token_id,
+            bos_token_id=bos_token_id,
+            eos_token_id=eos_token_id,
+            tie_word_embeddings=tie_word_embeddings,
+            **kwargs,
+        )

generation_config.json ADDED Viewed

	@@ -0,0 +1,9 @@

+{
+  "bos_token_id": 0,
+  "do_sample": true,
+  "eos_token_id": 0,
+  "max_window_size": 2147483647,
+  "pad_token_id": 0,
+  "top_k": 65536,
+  "transformers_version": "4.53.0"
+}

hf_rwkv_tokenizer.py ADDED Viewed

	@@ -0,0 +1,280 @@

+# coding=utf-8
+# Copyright 2024 The HuggingFace Inc. team.
+#
+# Licensed under the Apache License, Version 2.0 (the "License");
+# you may not use this file except in compliance with the License.
+# You may obtain a copy of the License at
+#
+#     http://www.apache.org/licenses/LICENSE-2.0
+#
+# Unless required by applicable law or agreed to in writing, software
+# distributed under the License is distributed on an "AS IS" BASIS,
+# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
+# See the License for the specific language governing permissions and
+# limitations under the License.
+"""Tokenization classes for RWKV."""
+import os
+import re
+from typing import TYPE_CHECKING, List, Optional, Tuple
+from transformers.tokenization_utils import AddedToken, PreTrainedTokenizer
+from transformers.utils import logging
+if TYPE_CHECKING:
+    pass
+logger = logging.get_logger(__name__)
+VOCAB_FILES_NAMES = {
+    "vocab_file": "rwkv_vocab_v20230424.txt",
+}
+class TRIE:
+    __slots__ = tuple("ch,to,values,front".split(","))
+    to: list
+    values: set
+    def __init__(self, front=None, ch=None):
+        self.ch = ch
+        self.to = [None for ch in range(256)]
+        self.values = set()
+        self.front = front
+    def __repr__(self):
+        fr = self
+        ret = []
+        while fr != None:
+            if fr.ch != None:
+                ret.append(fr.ch)
+            fr = fr.front
+        return "<TRIE %s %s>" % (ret[::-1], self.values)
+    def add(self, key: bytes, idx: int = 0, val=None):
+        if idx == len(key):
+            if val is None:
+                val = key
+            self.values.add(val)
+            return self
+        ch = key[idx]
+        if self.to[ch] is None:
+            self.to[ch] = TRIE(front=self, ch=ch)
+        return self.to[ch].add(key, idx=idx + 1, val=val)
+    def find_longest(self, key: bytes, idx: int = 0):
+        u: TRIE = self
+        ch: int = key[idx]
+        while u.to[ch] is not None:
+            u = u.to[ch]
+            idx += 1
+            if u.values:
+                ret = idx, u, u.values
+            if idx == len(key):
+                break
+            ch = key[idx]
+        return ret
+class RWKV_TOKENIZER:
+    def __init__(self, file_name):
+        self.idx2token = {}
+        sorted = []  # must be already sorted
+        with open(file_name, "r", encoding="utf-8") as f:
+            lines = f.readlines()
+        for l in lines:
+            idx = int(l[: l.index(" ")])
+            x = eval(l[l.index(" ") : l.rindex(" ")])
+            x = x.encode("utf-8") if isinstance(x, str) else x
+            assert isinstance(x, bytes)
+            assert len(x) == int(l[l.rindex(" ") :])
+            sorted += [x]
+            self.idx2token[idx] = x
+        self.token2idx = {}
+        for k, v in self.idx2token.items():
+            self.token2idx[v] = int(k)
+        self.root = TRIE()
+        for t, i in self.token2idx.items():
+            _ = self.root.add(t, val=(t, i))
+    def encodeBytes(self, src: bytes):
+        idx: int = 0
+        tokens = []
+        while idx < len(src):
+            _idx: int = idx
+            idx, _, values = self.root.find_longest(src, idx)
+            assert idx != _idx
+            _, token = next(iter(values))
+            tokens.append(token)
+        return tokens
+    def decodeBytes(self, tokens):
+        return b"".join(map(lambda i: self.idx2token[i], tokens))
+    def encode(self, src):
+        if isinstance(src, str):
+            return [self.encodeBytes(src.encode("utf-8"))]
+        elif isinstance(src, list):
+            return [self.encodeBytes(s.encode("utf-8")) for s in src]
+    def decode(self, tokens):
+        return [self.decodeBytes(batch).decode("utf-8") for batch in tokens]
+        # try:
+        #     return self.decodeBytes(tokens).decode('utf-8')
+        # except:
+        #     return '\ufffd' # bad utf-8
+    def printTokens(self, tokens):
+        for i in tokens:
+            s = self.idx2token[i]
+            try:
+                s = s.decode("utf-8")
+            except:
+                pass
+            print(f"{repr(s)}{i}", end=" ")
+        print()
+class RwkvTokenizer(PreTrainedTokenizer):
+    vocab_files_names = VOCAB_FILES_NAMES
+    model_input_names = ["input_ids", "attention_mask"]
+    def __init__(
+        self, vocab_file, bos_token="<|rwkv_tokenizer_end_of_text|>", eos_token="<|rwkv_tokenizer_end_of_text|>", unk_token="<|rwkv_tokenizer_end_of_text|>", **kwargs
+    ):
+        if not os.path.isfile(vocab_file):
+            raise ValueError(
+                f"Can't find a vocabulary file at path '{vocab_file}'."
+            )
+        with open(vocab_file, "r", encoding="utf-8") as reader:
+            tokens = reader.readlines()
+        if "add_bos_token" in kwargs:
+            self.add_bos_token = kwargs["add_bos_token"]
+        else:
+            self.add_bos_token = False
+        self.trie_tokenizer = RWKV_TOKENIZER(vocab_file)
+        vocab = self.trie_tokenizer.token2idx
+        self.encoder = vocab
+        self.decoder = {v: k for k, v in vocab.items()}
+        self._added_tokens_decoder = {0: AddedToken(str(bos_token))}
+        super().__init__(
+            bos_token=bos_token, eos_token=eos_token, unk_token=unk_token, **kwargs
+        )
+    @property
+    def vocab_size(self):
+        return len(self.encoder)
+    def get_vocab(self):
+        vocab = self.encoder
+        vocab.update(self.added_tokens_encoder)
+        vocab = dict(sorted(vocab.items(), key=lambda item: item[1]))
+        return vocab
+    def _tokenize(self, text, split_special_tokens=False):
+        # return self.wordpiece_tokenizer.tokenize(text.encode("utf-8"))
+        return self.trie_tokenizer.encode(text)[0]
+    def _convert_token_to_id(self, token):
+        return token
+    def _convert_id_to_token(self, index):
+        """Converts an index (integer) in a token (byte) using the vocab."""
+        token = self.decoder.get(index, self.unk_token)
+        if isinstance(token, (bytes)):
+            token = token.decode("utf-8", errors="replace")
+        return token
+    def convert_tokens_to_string(self, tokens):
+        """Converts a sequence of tokens (bytes) in a single string. Additional tokens are encoded to bytes"""
+        out_string = b"".join(
+            [k.encode(errors="replace") if isinstance(k, str) else k for k in tokens]
+        ).decode("utf-8")
+        return out_string
+    def save_vocabulary(
+        self, save_directory: str, filename_prefix: Optional[str] = None
+    ) -> Tuple[str]:
+        index = 0
+        if os.path.isdir(save_directory):
+            vocab_file = os.path.join(
+                save_directory,
+                (filename_prefix + "-" if filename_prefix else "") + "vocab.txt",
+            )
+        else:
+            vocab_file = (
+                filename_prefix + "-" if filename_prefix else ""
+            ) + save_directory
+        with open(vocab_file, "w", encoding="utf-8") as writer:
+            for token, token_index in sorted(
+                self.encoder.items(), key=lambda kv: kv[1]
+            ):
+                if index != token_index:
+                    logger.warning(
+                        f"Saving vocabulary to {vocab_file}: vocabulary indices are not consecutive."
+                        " Please check that the vocabulary is not corrupted!"
+                    )
+                    index = token_index
+                writer.write(str(token) + "\n")
+                index += 1
+        return (vocab_file,)
+    def build_inputs_with_special_tokens(self, token_ids_0, token_ids_1=None):
+        if self.add_bos_token:
+            bos_token_ids = [self.bos_token_id]
+        else:
+            bos_token_ids = []
+        output = bos_token_ids + token_ids_0
+        if token_ids_1 is None:
+            return output
+        return output + bos_token_ids + token_ids_1
+    def get_special_tokens_mask(
+        self,
+        token_ids_0: List[int],
+        token_ids_1: Optional[List[int]] = None,
+        already_has_special_tokens: bool = False,
+    ) -> List[int]:
+        """
+        Retrieves sequence ids from a token list that has no special tokens added. This method is called when adding
+        special tokens using the tokenizer `prepare_for_model` or `encode_plus` methods.
+        Args:
+            token_ids_0 (`List[int]`):
+                List of IDs.
+            token_ids_1 (`List[int]`, *optional*):
+                Optional second list of IDs for sequence pairs.
+            already_has_special_tokens (`bool`, *optional*, defaults to `False`):
+                Whether or not the token list is already formatted with special tokens for the model.
+        Returns:
+            `List[int]`: A list of integers in the range [0, 1]: 1 for a special token, 0 for a sequence token.
+        """
+        if already_has_special_tokens:
+            return super().get_special_tokens_mask(
+                token_ids_0=token_ids_0,
+                token_ids_1=token_ids_1,
+                already_has_special_tokens=True,
+            )
+        if not self.add_bos_token:
+            return super().get_special_tokens_mask(
+                token_ids_0=token_ids_0,
+                token_ids_1=token_ids_1,
+                already_has_special_tokens=False,
+            )
+        if token_ids_1 is None:
+            return [1] + ([0] * len(token_ids_0))
+        return [1] + ([0] * len(token_ids_0)) + [1] + ([0] * len(token_ids_1))

model-00001-of-00003.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:489de75c7b850d9dfcda08d669d17ff2cf766b4270f761627c29e636a2942e30
+size 4981971088

model-00002-of-00003.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:26b6811cc0d6dbf477b5a400c1f68e3045964f347f5dc3a880058c16ca2832f0
+size 4997326912

model-00003-of-00003.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b705a8d9b5b95913138fb752d7ab193041d2042a32f258567e3cc4bc882752eb
+size 4419100656

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,1067 @@

+{
+  "metadata": {
+    "total_parameters": 7199141888,
+    "total_size": 14398283776
+  },
+  "weight_map": {
+    "lm_head.weight": "model-00003-of-00003.safetensors",
+    "model.embeddings.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.0.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.0.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.0.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.0.pre_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.0.pre_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.1.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.1.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.1.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.1.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.10.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.10.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.10.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.10.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.10.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.11.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.11.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.11.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.11.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.11.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.12.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.12.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.12.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.12.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.13.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.13.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.13.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.13.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.14.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.14.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.14.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.14.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.15.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.15.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.15.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.15.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.16.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.16.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.16.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.16.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.17.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.17.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.17.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.17.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.18.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.18.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.18.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.18.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.19.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.19.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.19.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.19.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.2.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.2.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.2.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.2.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.2.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.20.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.20.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.20.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.20.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.20.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.21.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.ffn.value.weight": "model-00002-of-00003.safetensors",
+    "model.layers.21.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.21.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.21.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.a_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.a_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.a_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.g_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.g_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.g_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.g_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.k_a": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.k_k": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.k_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.o_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.r_k": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.r_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.v_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.v_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.v_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.v_proj.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.w_lora.lora.0.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.w_lora.lora.2.bias": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.w_lora.lora.2.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.x_a": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.x_g": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.x_r": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.x_v": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn.x_w": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.22.attn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.ffn.key.weight": "model-00002-of-00003.safetensors",
+    "model.layers.22.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.22.ffn.x_k": "model-00002-of-00003.safetensors",
+    "model.layers.22.ffn_norm.bias": "model-00002-of-00003.safetensors",
+    "model.layers.22.ffn_norm.weight": "model-00002-of-00003.safetensors",
+    "model.layers.23.attn.a_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.a_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.a_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.g_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.g_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.g_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.g_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.k_a": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.k_k": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.k_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.o_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.r_k": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.r_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.v_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.v_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.v_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.v_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.w_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.w_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.w_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.x_a": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.x_g": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.x_r": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.x_v": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn.x_w": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.23.attn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.ffn.key.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.23.ffn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.23.ffn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.23.ffn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.a_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.a_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.a_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.g_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.g_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.g_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.g_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.k_a": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.k_k": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.k_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.o_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.r_k": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.r_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.v_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.v_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.v_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.v_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.w_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.w_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.w_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.x_a": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.x_g": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.x_r": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.x_v": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn.x_w": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.24.attn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.ffn.key.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.24.ffn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.24.ffn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.24.ffn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.a_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.a_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.a_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.g_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.g_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.g_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.g_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.k_a": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.k_k": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.k_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.o_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.r_k": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.r_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.v_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.v_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.v_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.v_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.w_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.w_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.w_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.x_a": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.x_g": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.x_r": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.x_v": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn.x_w": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.25.attn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.ffn.key.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.25.ffn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.25.ffn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.25.ffn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.a_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.a_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.a_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.g_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.g_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.g_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.g_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.k_a": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.k_k": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.k_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.o_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.r_k": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.r_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.v_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.v_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.v_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.v_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.w_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.w_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.w_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.x_a": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.x_g": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.x_r": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.x_v": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn.x_w": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.26.attn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.ffn.key.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.26.ffn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.26.ffn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.26.ffn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.a_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.a_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.a_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.g_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.g_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.g_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.g_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.k_a": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.k_k": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.k_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.o_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.r_k": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.r_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.v_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.v_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.v_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.v_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.w_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.w_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.w_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.x_a": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.x_g": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.x_r": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.x_v": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn.x_w": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.27.attn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.ffn.key.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.27.ffn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.27.ffn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.27.ffn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.a_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.a_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.a_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.g_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.g_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.g_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.g_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.k_a": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.k_k": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.k_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.o_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.r_k": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.r_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.v_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.v_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.v_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.v_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.w_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.w_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.w_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.x_a": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.x_g": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.x_r": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.x_v": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn.x_w": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.28.attn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.ffn.key.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.28.ffn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.28.ffn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.28.ffn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.a_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.a_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.a_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.g_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.g_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.g_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.g_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.k_a": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.k_k": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.k_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.o_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.r_k": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.r_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.v_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.v_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.v_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.v_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.w_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.w_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.w_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.x_a": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.x_g": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.x_r": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.x_v": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn.x_w": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.29.attn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.ffn.key.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.29.ffn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.29.ffn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.29.ffn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.3.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.3.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.3.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.3.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.3.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.30.attn.a_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.a_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.a_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.g_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.g_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.g_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.g_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.k_a": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.k_k": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.k_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.o_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.r_k": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.r_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.v_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.v_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.v_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.v_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.w_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.w_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.w_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.x_a": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.x_g": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.x_r": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.x_v": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn.x_w": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.30.attn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.ffn.key.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.30.ffn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.30.ffn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.30.ffn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.a_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.a_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.a_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.g_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.g_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.g_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.g_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.k_a": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.k_k": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.k_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.o_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.r_k": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.r_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.v_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.v_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.v_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.v_proj.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.w_lora.lora.0.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.w_lora.lora.2.bias": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.w_lora.lora.2.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.x_a": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.x_g": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.x_r": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.x_v": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn.x_w": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.31.attn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.ffn.key.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.ffn.value.weight": "model-00003-of-00003.safetensors",
+    "model.layers.31.ffn.x_k": "model-00003-of-00003.safetensors",
+    "model.layers.31.ffn_norm.bias": "model-00003-of-00003.safetensors",
+    "model.layers.31.ffn_norm.weight": "model-00003-of-00003.safetensors",
+    "model.layers.4.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.4.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.4.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.4.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.4.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.5.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.5.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.5.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.5.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.6.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.6.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.6.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.6.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.7.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.7.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.7.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.7.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.8.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.8.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.8.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.8.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.a_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.a_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.a_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.g_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.g_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.g_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.g_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.k_a": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.k_k": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.k_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.o_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.r_k": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.r_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.v_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.v_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.v_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.v_proj.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.w_lora.lora.0.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.w_lora.lora.2.bias": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.w_lora.lora.2.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.x_a": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.x_g": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.x_r": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.x_v": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn.x_w": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.9.attn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.ffn.key.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.ffn.value.weight": "model-00001-of-00003.safetensors",
+    "model.layers.9.ffn.x_k": "model-00001-of-00003.safetensors",
+    "model.layers.9.ffn_norm.bias": "model-00001-of-00003.safetensors",
+    "model.layers.9.ffn_norm.weight": "model-00001-of-00003.safetensors",
+    "model.norm.bias": "model-00003-of-00003.safetensors",
+    "model.norm.weight": "model-00003-of-00003.safetensors"
+  }
+}

modeling_rwkv7.py ADDED Viewed

	@@ -0,0 +1,4 @@

+from fla.models.rwkv7 import RWKV7ForCausalLM, RWKV7Model, RWKV7Config
+RWKV7ForCausalLM = RWKV7ForCausalLM
+RWKV7Model = RWKV7Model
+RWKV7Config = RWKV7Config

rwkv_vocab_v20230424.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,24 @@

+{
+  "bos_token": {
+    "content": "<|rwkv_tokenizer_end_of_text|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": "\n\n",
+  "pad_token": {
+    "content": "<|rwkv_tokenizer_end_of_text|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<|rwkv_tokenizer_end_of_text|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,28 @@

+{
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<|rwkv_tokenizer_end_of_text|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "auto_map": {
+    "AutoTokenizer": [
+      "hf_rwkv_tokenizer.RwkvTokenizer",
+      null
+    ]
+  },
+  "bos_token": "<|rwkv_tokenizer_end_of_text|>",
+  "pad_token": "<|rwkv_tokenizer_end_of_text|>",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "\n\n",
+  "model_max_length": 1000000000000000019884624838656,
+  "tokenizer_class": "RwkvTokenizer",
+  "unk_token": "<|rwkv_tokenizer_end_of_text|>",
+  "use_fast": false,
+  "chat_template": "{{ '<|rwkv_tokenizer_end_of_text|>' }}{% for message in messages %}{% if message['role'] == 'user' %}{{'User: ' + message['content'] + '\n\n'}}{% elif message['role'] == 'system' %}{{'System: ' + message['content'] + '\n\n'}}{% elif message['role'] == 'assistant' %}{{'Assistant: ' + message['content'] + '\n\n'}}{% endif %}{% endfor %}{% if add_generation_prompt %}{% if enable_thinking is defined and enable_thinking == False %}{{ 'Assistant: <think></think>' }}{% else %}{{ 'Assistant: <think' }}{% endif %}{% endif %}"
+}