README

Milky2018/minigpt/tokenizer does not have a README file

#
TokenizerError

pub(all) suberror TokenizerError {
UnknownCharacter(Char)
UnknownToken(String)
InvalidTokenId(Int)
} derive(Eq,
Debug
)

#
BpeMerge

pub struct BpeMerge {
// private fields
}

#
BpeMerge::BpeMerge

fn BpeMerge::BpeMerge(left : String, right : String, merged : String) -> BpeMerge

#
BpeMerge::left

fn BpeMerge::left(self : BpeMerge) -> String

#
BpeMerge::merged

fn BpeMerge::merged(self : BpeMerge) -> String

#
BpeMerge::right

fn BpeMerge::right(self : BpeMerge) -> String

#
BpeTokenizer

pub struct BpeTokenizer {
// private fields
}

#
BpeTokenizer::decode

fn BpeTokenizer::decode(self : BpeTokenizer, ids : Array[Int]) -> String raise TokenizerError

#
BpeTokenizer::encode

fn BpeTokenizer::encode(self : BpeTokenizer, text : String) -> Array[Int] raise TokenizerError

#
BpeTokenizer::from_vocabulary_and_merges

fn BpeTokenizer::from_vocabulary_and_merges(vocabulary : Array[String], merges : Array[BpeMerge]) -> BpeTokenizer

#
BpeTokenizer::kind_name

fn BpeTokenizer::kind_name(_self : BpeTokenizer) -> String

#
BpeTokenizer::merges

fn BpeTokenizer::merges(self : BpeTokenizer) -> Array[BpeMerge]

#
BpeTokenizer::train

fn BpeTokenizer::train(text : String, vocab_size : Int) -> (BpeTokenizer, Array[Int])

#
BpeTokenizer::vocab_size

fn BpeTokenizer::vocab_size(self : BpeTokenizer) -> Int

#
BpeTokenizer::vocabulary

fn BpeTokenizer::vocabulary(self : BpeTokenizer) -> Array[String]

#
CharTokenizer

pub struct CharTokenizer {
// private fields
}

#
CharTokenizer::decode

fn CharTokenizer::decode(self : CharTokenizer, ids : Array[Int]) -> String raise TokenizerError

#
CharTokenizer::encode

fn CharTokenizer::encode(self : CharTokenizer, text : String) -> Array[Int] raise TokenizerError

#
CharTokenizer::from_chars

fn CharTokenizer::from_chars(chars : Array[Char]) -> CharTokenizer

#
CharTokenizer::kind_name

fn CharTokenizer::kind_name(_self : CharTokenizer) -> String

#
CharTokenizer::train

fn CharTokenizer::train(text : String) -> (CharTokenizer, Array[Int])

#
CharTokenizer::vocab_size

fn CharTokenizer::vocab_size(self : CharTokenizer) -> Int

#
CharTokenizer::vocabulary

fn CharTokenizer::vocabulary(self : CharTokenizer) -> Array[Char]

#
TokenDataset

pub struct TokenDataset {
// private fields
}

#
TokenDataset::tokenizer

fn TokenDataset::tokenizer(self : TokenDataset) -> Tokenizer

#
TokenDataset::train_ids

fn TokenDataset::train_ids(self : TokenDataset) -> Array[Int]

#
TokenDataset::val_ids

fn TokenDataset::val_ids(self : TokenDataset) -> Array[Int]

#
Tokenizer

pub(all) enum Tokenizer {
Character(CharTokenizer)
Word(WordTokenizer)
Bpe(BpeTokenizer)
}

#
Tokenizer::bpe_merges

fn Tokenizer::bpe_merges(self : Tokenizer) -> Array[BpeMerge]

#
Tokenizer::decode

fn Tokenizer::decode(self : Tokenizer, ids : Array[Int]) -> String raise TokenizerError

#
Tokenizer::encode

fn Tokenizer::encode(self : Tokenizer, text : String) -> Array[Int] raise TokenizerError

#
Tokenizer::from_bpe

fn Tokenizer::from_bpe(tokenizer : BpeTokenizer) -> Tokenizer

#
Tokenizer::from_char

fn Tokenizer::from_char(tokenizer : CharTokenizer) -> Tokenizer

#
Tokenizer::from_word

fn Tokenizer::from_word(tokenizer : WordTokenizer) -> Tokenizer

#
Tokenizer::kind_name

fn Tokenizer::kind_name(self : Tokenizer) -> String

#
Tokenizer::train

fn Tokenizer::train(text : String, config : TokenizerConfig) -> (Tokenizer, Array[Int])

#
Tokenizer::train_bpe

fn Tokenizer::train_bpe(text : String, vocab_size : Int) -> (Tokenizer, Array[Int])

#
Tokenizer::train_char

fn Tokenizer::train_char(text : String) -> (Tokenizer, Array[Int])

#
Tokenizer::train_word

fn Tokenizer::train_word(text : String) -> (Tokenizer, Array[Int])

#
Tokenizer::vocab_size

fn Tokenizer::vocab_size(self : Tokenizer) -> Int

#
Tokenizer::vocabulary

fn Tokenizer::vocabulary(self : Tokenizer) -> Array[String]

#
TokenizerConfig

pub(all) enum TokenizerConfig {
CharacterLevel
WordLevel
BpeLevel(Int)
} derive(Eq,
Debug
)

#
WordTokenizer

pub struct WordTokenizer {
// private fields
}

#
WordTokenizer::decode

fn WordTokenizer::decode(self : WordTokenizer, ids : Array[Int]) -> String raise TokenizerError

#
WordTokenizer::encode

fn WordTokenizer::encode(self : WordTokenizer, text : String) -> Array[Int] raise TokenizerError

#
WordTokenizer::from_tokens

fn WordTokenizer::from_tokens(tokens : Array[String]) -> WordTokenizer

#
WordTokenizer::kind_name

fn WordTokenizer::kind_name(_self : WordTokenizer) -> String

#
WordTokenizer::train

fn WordTokenizer::train(text : String) -> (WordTokenizer, Array[Int])

#
WordTokenizer::vocab_size

fn WordTokenizer::vocab_size(self : WordTokenizer) -> Int

#
WordTokenizer::vocabulary

fn WordTokenizer::vocabulary(self : WordTokenizer) -> Array[String]

#
DEFAULT_BPE_VOCAB_SIZE

let DEFAULT_BPE_VOCAB_SIZE : Int

#
prepare_token_dataset

fn prepare_token_dataset(text : String, config : TokenizerConfig) -> TokenDataset

Source Files

Powered by MoonBit

Site sourceReport issuePackagesBuild queueSkillsStatistics

© 2026 mooncakes.io