Saltar al contenido
SHENZHEN · 深圳 — 22°32′N 114°03′E
← MODELOS

FICHA · XIAOMI

MiMo V2.5

El multimodal de Xiaomi: un millón de tokens, imagen y audio, por céntimos. El más barato del catálogo que ve imágenes.

EXPEDIENTE

FABRICANTE
Xiaomi
CONTEXTO
1.1M tokens
COSTE
Económico
PRECIO
0,14 $ por millón de tokens de entrada · 0,28 $ de salida
ID EN OPENROUTER
xiaomi/mimo-v2.5

CONTEXTO Y PRECIO, DEL CATÁLOGO DE OPENROUTER, LEÍDOS EL 25 DE SEPTIEMBRE DE 2026 · FICHA ESCRITA EL 8 DE SEPTIEMBRE DE 2026

Qué hace bien

Es el modelo más barato de esta lista que acepta imágenes, y además tiene un millón de tokens de contexto. Esa combinación no la tiene ningún otro multimodal del catálogo por este dinero.

Acepta también audio, cosa poco común: es el único de la lista que lo hace.

Viene de Xiaomi, que no es el nombre que uno espera en una lista de modelos de IA. Publica en abierto desde hace relativamente poco.

Dónde se queda corto

Es barato y se comporta como tal en lo difícil. Con una imagen clara y una pregunta directa responde bien; con texto pequeño, manuscrito o un gráfico con muchas series, se le escapan cosas.

En español escribe correcto, no bien. Para el pie de una descripción da igual; para un texto que vayas a publicar, no.

No razona paso a paso.

Cuándo elegirlo

  • Muchas imágenes y preguntas sencillas sobre ellas.
  • Cuando el material es largo y lleva imágenes, y el presupuesto manda.
  • Extraer datos de documentos escaneados en cantidad.

Cuándo no

  • Si la imagen es exigente: Qwen3.8 Max.
  • Si el texto de salida va a leerse tal cual: GLM 5.3 Flash escribe mejor por poco más.

Es un caso parecido al de Ling 3.0 Flash en texto: el precio es tan bajo que cambia lo que es razonable pedirle. Tareas que no harías por no gastar, aquí salen casi gratis.

EN VEZ DE ESTE