Ollama
Ollama Inc. · Texto y chat · desde 2023
Ejecuta modelos abiertos (Gemma, Qwen, DeepSeek, Kimi) en tu propio equipo con CLI, app de escritorio y API compatible con OpenAI; cloud opcional de pago.
Qué es Ollama
Ollama es la forma más directa de ejecutar modelos abiertos en un ordenador propio: un comando (`ollama run gemma4`) descarga el modelo y lo sirve en local en el puerto 11434, con app de escritorio para macOS y Windows, CLI para las tres plataformas e imagen Docker oficial. El motor es open source bajo licencia MIT y supera las 180.000 estrellas en GitHub.
Expone una API REST propia y un subconjunto de la API de OpenAI (chat completions, completions, embeddings, models y responses), de modo que cualquier cliente compatible con OpenAI —y agentes de código como Claude Code, Codex u OpenCode— puede apuntar a un modelo local sin cambiar código. Hay librerías oficiales para Python y JavaScript.
Ollama Cloud permite usar modelos grandes (Kimi K3, DeepSeek V4, GLM 5.3, Qwen 3.5, gpt-oss) sin GPU propia. Desde el 31/08/2026 se factura por token con bolsas de uso mensual incluidas en Pro, Max y Team, sin registro de prompts ni respuestas y con servidores principalmente en EE. UU. y capacidad adicional en Europa y Singapur.
Para qué sirve de verdad
- Montar un asistente o clasificador interno con datos que no pueden salir del servidor del cliente
- Servir un modelo local como backend OpenAI-compatible para n8n, VS Code o scripts propios
- Probar modelos abiertos nuevos en minutos antes de decidir un proveedor
- Dar a agentes de código (Claude Code, Codex, OpenCode) un modelo abierto más barato
- Escalar a modelos grandes vía Ollama Cloud sin comprar GPU
Puntos fuertes
- + Instalación y uso en un comando; MIT y gratuito en local
- + API compatible con OpenAI y Anthropic en el puerto 11434
- + Catálogo actualizado con los modelos abiertos más recientes
- + Cloud con precio por token transparente y sin retención de datos
Limitaciones
- − La calidad en local depende de la RAM y la GPU disponibles; los modelos grandes exigen su cloud
- − Sin interfaz de chat elaborada: la app de escritorio es básica frente a LM Studio
- − El cloud se aloja principalmente en EE. UU.; para datos sensibles conviene quedarse en local
Precio de Ollama
Tiene plan gratuito. Planes: Local gratis (MIT) · Cloud: Free con créditos iniciales · Pro 20 $/mes o 200 $/año (60 $ de uso al mes, 3 peticiones concurrentes) · Max 100 $/mes (300 $ de uso, 10 concurrentes) · Team 500 $/mes (1.000 $ de uso compartido, usuarios ilimitados) · Enterprise a consultar. Facturación por token desde el 31/08/2026, sin límites de 5 horas ni semanales; p. ej. deepseek-v4.1-flash 0,15 $/0,60 $ por millón de tokens (entrada/salida). Precios en USD en ollama.com/pricing a 16/09/2026; impuestos aparte.
ORO://veredicto de agencia
Cuándo la elegiríamos nosotros
Nuestra primera opción para prototipos y automatizaciones con datos sensibles que no pueden salir del servidor del cliente; para producción con carga real o modelos muy grandes hay que pasar a su cloud o a un proveedor con SLA.
Preguntas frecuentes sobre Ollama
¿Ollama es gratis?
Sí, tiene plan gratuito. Planes: Local gratis (MIT) · Cloud: Free con créditos iniciales · Pro 20 $/mes o 200 $/año (60 $ de uso al mes, 3 peticiones concurrentes) · Max 100 $/mes (300 $ de uso, 10 concurrentes) · Team 500 $/mes (1.000 $ de uso compartido, usuarios ilimitados) · Enterprise a consultar. Facturación por token desde el 31/08/2026, sin límites de 5 horas ni semanales; p. ej. deepseek-v4.1-flash 0,15 $/0,60 $ por millón de tokens (entrada/salida). Precios en USD en ollama.com/pricing a 16/09/2026; impuestos aparte.
¿Ollama funciona en español?
Sí. Ollama funciona en español, tanto la interfaz como los resultados en la mayoría de casos.
¿Para quién es Ollama?
Ejecuta modelos abiertos (Gemma, Qwen, DeepSeek, Kimi) en tu propio equipo con CLI, app de escritorio y API compatible con OpenAI; cloud opcional de pago. Nivel recomendado: intermedio. Nuestra primera opción para prototipos y automatizaciones con datos sensibles que no pueden salir del servidor del cliente; para producción con carga real o modelos muy grandes hay que pasar a su cloud o a un proveedor con SLA.
Fuentes: ollama.com · ollama.com · ollama.com · docs.ollama.com · docs.ollama.com · ollama.com · ollama.com · github.com