jina-vlm: Small Multilingual Vision Language Model

A 2.4B parameter multilingual VLM that couples a SigLIP2 vision encoder with a Qwen3 language decoder. Ask it any question about an image in 29+ languages.

Model Card | Paper | Blog

64 2048
Examples
Image Question / Prompt