IA local

Cómo correr tu primer modelo de IA local con Ollama

Ejecutar un modelo de lenguaje en tu propia máquina dejó de ser algo reservado a laboratorios. Con Ollama, una herramienta de código abierto, podés tener un asistente tipo ChatGPT corriendo en tu servidor o tu notebook en cuestión de minutos, sin enviar una sola línea de texto a internet.

¿Por qué correr un modelo local?

La razón principal es la privacidad: tus prompts y tus documentos nunca salen de tu infraestructura. A eso se suma el control de costos (no pagás por token) y la independencia de proveedores externos que pueden cambiar precios o discontinuar el servicio.

Si trabajás con información sensible —datos de clientes, historias clínicas, documentación legal— la IA local no es un lujo, es un requisito.

Instalación en tres pasos

Ollama corre en Linux, macOS y Windows. En un servidor GNU/Linux, la instalación es directa:

  • 1. Instalar Ollama: un único comando descarga y configura el servicio.
  • 2. Descargar un modelo: por ejemplo llama3 o mistral, con un simple pull.
  • 3. Conversar: desde la terminal o vía su API HTTP local en el puerto 11434.

¿Qué modelo elegir?

Depende de tu hardware. Modelos de 7B a 8B de parámetros corren razonablemente en una GPU de gama media o incluso en CPU con paciencia. Para tareas más exigentes, modelos de 70B necesitan GPUs dedicadas con suficiente VRAM.

Integrarlo a tus sistemas

Lo interesante es que Ollama expone una API compatible con el estándar de OpenAI. Eso significa que podés conectar tus aplicaciones existentes a tu modelo local cambiando apenas la URL del endpoint, sin reescribir tu código.

¿Querés implementar esto en tu empresa?
En Intelix lo hacemos on-premise, con software libre y sin filtrar tus datos a la nube.

Hablemos por WhatsApp →