BananaMind/BananaMind-2-Pro 路 Hugging Face
Log In<br>Sign Up
","bos_token":"","eos_token":"","unk_token":""}},"createdAt":"2026-08-14T15:41:43.000Z","discussionsDisabled":false,"discussionsSorting":"recently-created","downloads":0,"downloadsAllTime":0,"id":"BananaMind/BananaMind-2-Pro","isLikedByUser":false,"availableInferenceProviders":[],"showHuggingChatEntry":false,"inference":"","lastModified":"2026-08-14T15:41:59.000Z","likes":5,"pipeline_tag":"text-generation","library_name":"transformers","librariesOther":[],"trackDownloads":true,"model-index":null,"private":false,"repoType":"model","gated":false,"tags":["transformers","safetensors","bananamind2_pro","text-generation","causal-lm","language-model","base-model","small-language-model","bananamind","bananamind2","bananamind2-pro","pretrained","100b-tokens","digit-tokenizer","pytorch","custom-code","trust-remote-code","custom-architecture","custom_code","en","dataset:HuggingFaceFW/fineweb-edu","dataset:mlfoundations/dclm-baseline-1.0","dataset:HuggingFaceTB/smollm-corpus","dataset:HuggingFaceTB/finemath","license:other","region:us"],"tag_objs":[{"id":"text-generation","label":"Text Generation","type":"pipeline_tag","subType":"nlp"},{"id":"transformers","label":"Transformers","type":"library"},{"id":"safetensors","label":"Safetensors","type":"library"},{"id":"pytorch","label":"PyTorch","type":"library"},{"id":"dataset:HuggingFaceFW/fineweb-edu","label":"HuggingFaceFW/fineweb-edu","type":"dataset","extra":{"disabled":false}},{"id":"dataset:mlfoundations/dclm-baseline-1.0","label":"mlfoundations/dclm-baseline-1.0","type":"dataset","extra":{"disabled":false}},{"id":"dataset:HuggingFaceTB/smollm-corpus","label":"HuggingFaceTB/smollm-corpus","type":"dataset","extra":{"disabled":false}},{"id":"dataset:HuggingFaceTB/finemath","label":"HuggingFaceTB/finemath","type":"dataset","extra":{"disabled":false}},{"id":"en","label":"English","type":"language"},{"id":"bananamind2_pro","label":"bananamind2_pro","type":"other","clickable":true},{"id":"causal-lm","label":"causal-lm","type":"other","clickable":true},{"id":"language-model","label":"language-model","type":"other","clickable":true},{"id":"base-model","label":"base-model","type":"other","clickable":true},{"id":"small-language-model","label":"small-language-model","type":"other","clickable":true},{"id":"bananamind","label":"bananamind","type":"other","clickable":true},{"id":"bananamind2","label":"bananamind2","type":"other","clickable":true},{"id":"bananamind2-pro","label":"bananamind2-pro","type":"other","clickable":true},{"id":"pretrained","label":"pretrained","type":"other","clickable":true},{"id":"100b-tokens","label":"100b-tokens","type":"other","clickable":true},{"id":"digit-tokenizer","label":"digit-tokenizer","type":"other","clickable":true},{"id":"custom-code","label":"custom-code","type":"other","clickable":true},{"id":"trust-remote-code","label":"trust-remote-code","type":"other","clickable":true},{"id":"custom-architecture","label":"custom-architecture","type":"other","clickable":true},{"id":"custom_code","label":"custom_code","type":"other","clickable":true},{"id":"license:other","label":"other","type":"license"},{"type":"region","label":"馃嚭馃嚫 Region: US","id":"region:us"}],"transformersInfo":{"auto_model":"AutoModelForCausalLM","custom_class":"modeling_bananamind2pro.BananaMind2ProForCausalLM","pipeline_tag":"text-generation"},"widgetData":[{"text":"My name is Julien and I like to"},{"text":"I like traveling by train because"},{"text":"Paris is an amazing place to visit,"},{"text":"Once upon a time,"}],"safetensors":{"parameters":{"F32":159943040},"total":159943040,"sharded":false,"totalFileSize":639800304},"hasBlockedOids":false,"region":"us","isQuantized":false,"licenseFilePath":"LICENSE"},"discussionsStats":{"closed":0,"open":0,"total":0},"query":{},"inferenceContextData":{"billableEntities":[],"entityName2Providers":{}},"hasQuantizations":false,"copyToBucketNamespaces":[]}">
BananaMind-2-Pro
BananaMind-2-Pro is a 138,971,520-parameter decoder-only base language model trained from scratch by BananaMind. The completed pretraining run processed 99,999,449,088 tokens 鈥攖he scheduled realization of a 100B-token curriculum鈥攐ver 184,954 optimizer steps .
The model has a 3,072-token context window and a custom 32,768-token digit-aware byte-level BPE tokenizer . Its architecture uses grouped-query attention, QK normalization, RoPE, SwiGLU, RMSNorm, tied input/output embeddings, and a KV cache for generation.
This is a base model, not an instruction-tuned or chat model. Use continuation-style prompts and load the repository with trust_remote_code=True.
Release Status
Field<br>Value
Release type<br>Final base checkpoint
Checkpoint step<br>184,953
Optimizer steps completed<br>184,954
Tokens seen<br>99,999,449,088
Training target<br>100B tokens
Final phase<br>Quality finish
Training status<br>Complete
Evaluation status<br>Complete
Model Details
Field<br>Value
Parameters<br>138,971,520
Architecture<br>BananaMind2Pro decoder-only...