Text preprocessing utilities.

This module provides:
  • Tokenizers: Word, N-gram, Regex, Sentence tokenization
  • Vectorizers: CountVectorizer, TfidfVectorizer, HashingVectorizer
  • Cleaners: Text cleaning, stop word removal, stemming
python
>>> from tuiml.preprocessing.text import TfidfVectorizer, WordTokenizer
>>>
>>> # Tokenize text
>>> tokenizer = WordTokenizer()
>>> tokens = tokenizer.tokenize("Hello, World!")
>>> print(tokens)  # ['hello', 'world']
>>>
>>> # Convert to TF-IDF
>>> vectorizer = TfidfVectorizer(stop_words='english', max_features=1000)
>>> X = vectorizer.fit_transform(documents)

Modules