MiMo V2.5
El multimodal de Xiaomi: un millón de tokens, imagen y audio, por céntimos. El más barato del catálogo que ve imágenes.
EXPEDIENTE
- Xiaomi
- 1.1M tokens
- Económico
- 0,14 $ por millón de tokens de entrada · 0,28 $ de salida
- xiaomi/mimo-v2.5
Qué hace bien
Es el modelo más barato de esta lista que acepta imágenes, y además tiene un millón de tokens de contexto. Esa combinación no la tiene ningún otro multimodal del catálogo por este dinero.
Acepta también audio, cosa poco común: es el único de la lista que lo hace.
Viene de Xiaomi, que no es el nombre que uno espera en una lista de modelos de IA. Publica en abierto desde hace relativamente poco.
Dónde se queda corto
Es barato y se comporta como tal en lo difícil. Con una imagen clara y una pregunta directa responde bien; con texto pequeño, manuscrito o un gráfico con muchas series, se le escapan cosas.
En español escribe correcto, no bien. Para el pie de una descripción da igual; para un texto que vayas a publicar, no.
No razona paso a paso.
Cuándo elegirlo
- Muchas imágenes y preguntas sencillas sobre ellas.
- Cuando el material es largo y lleva imágenes, y el presupuesto manda.
- Extraer datos de documentos escaneados en cantidad.
Cuándo no
- Si la imagen es exigente: Qwen3.8 Max.
- Si el texto de salida va a leerse tal cual: GLM 5.3 Flash escribe mejor por poco más.
Es un caso parecido al de Ling 3.0 Flash en texto: el precio es tan bajo que cambia lo que es razonable pedirle. Tareas que no harías por no gastar, aquí salen casi gratis.
EN VEZ DE ESTE