CanMyPCRunAILocal AI compatibility

Cómo configurar tu PC para ejecutar modelos de IA en local

Ejecutar un modelo de IA en tu propio ordenador lleva unos veinte minutos, y casi todo ese tiempo es la descarga. No hace falta cuenta ni suscripción, y una vez que los pesos están en tu disco funciona sin conexión: tus mensajes nunca salen de la máquina.

Esta guía utiliza Ollama, que es gratuito, de código abierto y la forma más sencilla de poner un modelo en marcha. Se encarga de descargar los pesos, de usar tu GPU cuando puede y de servir el modelo, así que toda la instalación se reduce a un instalador y un comando.

Esta página es una traducción. El original está en inglés.

Paso 1 — Comprueba qué puede ejecutar tu PC

El tamaño del modelo lo limita la memoria antes que ninguna otra cosa. Un modelo que cabe en la VRAM de tu tarjeta gráfica va rápido; uno que no cabe hay que repartirlo con la RAM del sistema, lo que funciona pero es bastante más lento; y uno que no cabe en ninguna de las dos no llega a cargarse.

Averiguarlo descargando 20 GB de pesos es el camino largo, así que compruébalo antes.

Paso 2 — Instala Ollama

Descarga el instalador para tu sistema operativo y ejecútalo. En Windows instala un servicio en segundo plano y añade el comando ollama; no hay nada que configurar después.

Descargar Ollama desde ollama.com

Windows, macOS y Linux. Merece la pena acostumbrarse a descargarlo solo desde ollama.com: las copias de herramientas de IA populares son una vía habitual para distribuir otra cosa.

Paso 3 — Descarga y ejecuta tu primer modelo

Abre un terminal —Símbolo del sistema o PowerShell en Windows, Terminal en macOS o Linux— y ejecuta un solo comando. La primera vez descarga el modelo y abre un chat con él:

ollama run gemma3

Unos 3 GB. La descarga ocurre una vez; después el modelo arranca en segundos.

Cuando termine verás un prompt. Escribe una pregunta, pulsa Enter y la respuesta se genera en tu propio hardware. Escribe /bye para salir del chat.

Empieza por algo pequeño aunque tu PC dé para más: un modelo de 3B o 4B confirma en unos minutos que todo funciona, y luego ya puedes subir. Sustituye el nombre por cualquier modelo del catálogo, donde se indica lo que necesita cada uno.

Paso 4 — Los comandos que conviene conocer

Estos cinco cubren casi todo el día a día:

ollama pull qwen3:8b

Descarga un modelo sin abrir un chat.

ollama list

Lista los modelos que ya tienes en disco, con su tamaño.

ollama rm qwen3:8b

Borra un modelo y recupera el espacio.

ollama show gemma3

Muestra lo que necesita un modelo y cómo está configurado.

ollama ps

Muestra qué modelos están cargados en memoria ahora mismo.

Un nombre como qwen3:8b es el modelo seguido de la variante. La parte posterior a los dos puntos elige el tamaño y la cuantización; si la omites obtienes la predeterminada, que suele ser una variante de 4 bits de tamaño medio. Cada página de modelo de este sitio indica las variantes disponibles y la memoria que necesita cada una.

Dónde se guardan los modelos

Los pesos ocupan varios gigabytes cada uno y van a tu disco de sistema por defecto:

SistemaUbicación
Windows%USERPROFILE%\.ollama\models
macOS~/.ollama/models
Linux/usr/share/ollama/.ollama/models

Si tu disco de sistema va justo, define la variable de entorno OLLAMA_MODELS apuntando a una carpeta de otro disco y reinicia Ollama. Los modelos ya descargados se quedan donde están salvo que los muevas tú.

Usarlo desde tus propias aplicaciones

Mientras se ejecuta, Ollama ofrece una API local en el puerto 11434. Es a lo que se conectan las interfaces de chat de escritorio y las extensiones de editor, y es como llamarías a un modelo desde tu propio código: nada sale de tu máquina.

curl http://localhost:11434/api/generate -d "{\"model\":\"gemma3\",\"prompt\":\"Why is the sky blue?\"}"

Una petición HTTP normal al modelo que corre en tu propio PC.

Si va lento

  • Comprueba que está usando la GPU. Ejecuta ollama ps con un modelo cargado: indica cuánto hay en la GPU. Un modelo que aparece entero en la CPU es la causa habitual de las respuestas lentas.
  • Usa una variante más pequeña. Un modelo que no cabe en la VRAM se reparte con la RAM del sistema, y la parte descargada va a una fracción de la velocidad. Bajar un tamaño suele ser muchísimo más rápido.
  • Acorta el contexto. La caché KV crece con la ventana de contexto y compite con los pesos por la misma memoria, así que un contexto largo puede dejar fuera de la VRAM a un modelo que de otro modo cabría.
  • Actualiza los controladores de la GPU. La aceleración depende de ellos, y un controlador antiguo puede significar que la GPU no se use en absoluto.

Preguntas frecuentes

¿Necesito una tarjeta gráfica para ejecutar modelos de IA en local?
No, pero cambia lo que resulta práctico. Ollama funciona solo con la CPU usando la RAM del sistema, lo que sirve para modelos pequeños y es lento con los grandes. Una GPU dedicada mantiene el modelo en la VRAM y suele ser muchas veces más rápida, así que la cantidad de VRAM decide qué modelos son cómodos, no solo cuáles son posibles.
¿Cuánta RAM y VRAM necesito?
Como regla aproximada, un modelo cuantizado a 4 bits necesita unos 0,6 GB por cada mil millones de parámetros, más memoria para la ventana de contexto y la sobrecarga del motor. Un modelo de 8B pide por tanto unos 6 GB de VRAM con un contexto corto. Es solo una orientación: el análisis de este sitio lo calcula a partir de tu hardware real y de la variante exacta que quieras ejecutar.
¿Ollama es gratis y funciona sin conexión?
Ollama es gratuito y de código abierto, y no requiere cuenta. Descargar un modelo necesita conexión, pero una vez que los pesos están en tu disco el modelo se ejecuta enteramente en tu máquina, sin conexión, y tus mensajes no se envían a ningún sitio.
¿Dónde guarda Ollama los modelos?
En Windows los pesos van a %USERPROFILE%\.ollama\models, en macOS a ~/.ollama/models y en Linux a /usr/share/ollama/.ollama/models. Cada modelo ocupa varios gigabytes, así que si tu disco de sistema anda escaso puedes indicarle otra carpeta con la variable de entorno OLLAMA_MODELS.
¿Con qué modelo debería empezar?
Empieza por uno pequeño: una variante de 3B o 4B se descarga en unos minutos, funciona en equipos modestos y basta para confirmar que todo va bien. Cuando sepas que la instalación es correcta, sube al modelo más grande que tu hardware admita con holgura.
¿Puedo usar Ollama sin la línea de comandos?
Sí. Ollama expone una API local en el puerto 11434, y varias interfaces de escritorio y de navegador se conectan a ella para darte una ventana de chat. La línea de comandos es solo la forma más rápida de poner en marcha el primer modelo.

¿No sabes qué modelo instalar?

Analiza tu PC y obtén la lista de todos los modelos que puede ejecutar, con la memoria que necesita cada uno y por qué. Tarda un minuto y no requiere cuenta.