A 2.4B parameter multilingual VLM that couples a SigLIP2 vision encoder with a Qwen3 language decoder. Ask it any question about an image in 29+ languages.
Model Card | Paper | Blog