Ejecutar un modelo de lenguaje en tu propia máquina dejó de ser algo reservado a laboratorios. Con Ollama, una herramienta de código abierto, podés tener un asistente tipo ChatGPT corriendo en tu servidor o tu notebook en cuestión de minutos, sin enviar una sola línea de texto a internet.
¿Por qué correr un modelo local?
La razón principal es la privacidad: tus prompts y tus documentos nunca salen de tu infraestructura. A eso se suma el control de costos (no pagás por token) y la independencia de proveedores externos que pueden cambiar precios o discontinuar el servicio.
Instalación en tres pasos
Ollama corre en Linux, macOS y Windows. En un servidor GNU/Linux, la instalación es directa:
- 1. Instalar Ollama: un único comando descarga y configura el servicio.
- 2. Descargar un modelo: por ejemplo llama3 o mistral, con un simple pull.
- 3. Conversar: desde la terminal o vía su API HTTP local en el puerto 11434.
¿Qué modelo elegir?
Depende de tu hardware. Modelos de 7B a 8B de parámetros corren razonablemente en una GPU de gama media o incluso en CPU con paciencia. Para tareas más exigentes, modelos de 70B necesitan GPUs dedicadas con suficiente VRAM.
Integrarlo a tus sistemas
Lo interesante es que Ollama expone una API compatible con el estándar de OpenAI. Eso significa que podés conectar tus aplicaciones existentes a tu modelo local cambiando apenas la URL del endpoint, sin reescribir tu código.
¿Querés implementar esto en tu empresa?
En Intelix lo hacemos on-premise, con software libre y sin filtrar tus datos a la nube.