mirror of
https://github.com/microsoft/BitNet.git
synced 2026-08-23 17:36:31 +00:00
Fix vocab encoding by disabling add_special_tokens in tokenizer.encode
This commit is contained in:
@@ -278,7 +278,7 @@ class Model(ABC):
|
||||
elif reverse_vocab[i] in added_vocab:
|
||||
# We need to manually encode and decode the added tokens in case special characters
|
||||
# used for `\n` / `\t` have been manually added in the added tokens
|
||||
encoded_decoded_token = tokenizer.decode(tokenizer.encode(reverse_vocab[i]))
|
||||
encoded_decoded_token = tokenizer.decode(tokenizer.encode(reverse_vocab[i], add_special_tokens=False))
|
||||
tokens.append(encoded_decoded_token)
|
||||
if tokenizer.added_tokens_decoder[i].special:
|
||||
toktypes.append(gguf.TokenType.CONTROL)
|
||||
|
||||
Reference in New Issue
Block a user