Chinese word segmentation based on jieba
fn main raise {
let tokenizer = @jieba.Tokenizer()
let words = tokenizer.cut(
"小明硕士毕业于中国科学院计算所",
mode=Search,
)
println(words.join(" / "))
}fn main raise {
let tokenizer = @jieba.Tokenizer()
tokenizer.load_user_dictionary(
(
#|生成式人工智能 100000 nz
#|向量数据库 100000 nz
#|混合检索 100000 nz
),
)
println(tokenizer.cut("生成式人工智能与向量数据库的混合检索"))
}moon -C examples run search --target native
moon -C examples run search --target js
moon -C examples run search --target wasm-gcpub struct Tokenizer {
dictionary : Dictionary
hmm_model : HmmModel?
}
fn Tokenizer::Tokenizer() -> Tokenizer raise JiebaErrorfn Tokenizer::from_resources(dictionary : String, hmm_model? : String) -> Tokenizer raise JiebaErrorChinese word segmentation based on jieba