¿Por qué ejecutar Claude Code en local?

El atractivo es claro. Si revisas código propietario, trabajas con restricciones de seguridad o simplemente prefieres evitar herramientas que dependan de la nube, ejecutar el análisis de código en local ofrece tres ventajas concretas:

  • Privacidad total. Tu código nunca sale de tu máquina. Sin transmisión, sin registros, sin acceso de terceros.
  • Sin suscripciones. Una vez montada la infraestructura, no hay coste por petición ni tarifas de API.
  • Sin dependencia de un proveedor. Tú controlas qué modelos se ejecutan y dónde, y puedes cambiarlos o adaptarlos con facilidad.

La contrapartida también es clara: los modelos abiertos locales suelen ser menos capaces que Claude (la versión en la nube). Son mejores generando y explicando código, y menos finos en razonamientos complejos de varios pasos. Para muchas tareas de revisión — detectar fallos evidentes, comprobar el estilo, cazar señales de alarma de seguridad — dan de sobra. Para un análisis arquitectónico con matices, quizá sigas prefiriendo el razonamiento en la nube.

Qué necesitas: herramientas y hardware

Necesitarás tres piezas: Ollama (el entorno de ejecución local de modelos), un LLM capaz con código y Claude Code (el marco de agente de Anthropic). Empecemos por la base de hardware, porque de ahí depende que la experiencia funcione o no.

Requisitos de hardware

Para una revisión de código realmente usable — no demos de juguete — deberías apuntar a:

Component Minimum Recommended Comfortable
RAM 16 GB 32 GB 32 GB+
GPU VRAM 8 GB NVIDIA/AMD 16 GB 24 GB+
GPU Type Any CUDA/ROCm card RTX 3080 o mejor RTX 4090 o Mac serie M con 32 GB o más
Storage 50 GB free 100 GB free 150+ GB

Un Mac con Apple Silicon y 32 GB de memoria unificada funciona bastante bien. En PC, una RTX 3090 o una RTX 4080 te dan margen cómodo para modelos más grandes. Si solo tienes 8 GB de VRAM, aún puedes ejecutar modelos de 7B, pero espera una inferencia más lenta y posibles atascos al procesar archivos grandes.

Elección de modelo

No todos los modelos abiertos sirven igual para trabajar con código. Dos destacan a principios de 2026:

  • Qwen 2.5 Coder. Disponible en variantes de 7B y 32B. Excelente generando y analizando código. La versión de 7B cabe cómodamente en 8 GB de VRAM; la de 32B necesita entre 16 y 20 GB. Inferencia rápida y buen seguimiento de instrucciones.
  • GLM 4.7 Flash. Muy rápido, con ventana de contexto de 128K. Bueno para revisar archivos grandes de una sentada. Más ligero que Qwen en memoria, pero algo menos preciso en tareas específicas de código.

Para la mayoría de quienes empiezan, Qwen 2.5 Coder (7B) es el mejor punto de partida. Es lo bastante rápido para dar respuesta en el momento, lo bastante capaz para un análisis de código con sentido, y cabe en hardware modesto.

Puesta en marcha, paso a paso

1. Instala Ollama

Descarga Ollama desde ollama.com. Está disponible para macOS, Linux y Windows. La instalación es directa — ejecuta el instalador y deja que termine.

Verifica la instalación abriendo una terminal y escribiendo:

ollama --version

Deberías ver un número de versión. Si estás en Linux, comprueba también que se detecta tu GPU:

ollama list

2. Descarga un modelo

Descarga Qwen 2.5 Coder:

ollama pull qwen2.5-coder:7b

Esto baja unos 5 GB de pesos de modelo cuantizados. Con una conexión de banda ancha normal, cuenta entre 5 y 15 minutos. Ollama se encarga de todo — descompresión, conversión de formato, optimización.

Si tienes 16 GB de VRAM, puedes probar la versión de 32B:

ollama pull qwen2.5-coder:32b

3. Arranca el servidor de Ollama

Ollama funciona como servicio en segundo plano. Arráncalo con:

ollama serve

El servidor escucha en http://localhost:11434 por defecto. Deja esa terminal abierta o configura Ollama para que arranque solo como servicio del sistema (varía según el sistema operativo).

4. Configura Claude Code

Claude Code lee tres variables de entorno para conectarse a tu instancia local de Ollama. Defínelas antes de lanzarlo:

export ANTHROPIC_AUTH_TOKEN="ollama"
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL="http://localhost:11434"

En Windows (PowerShell), usa:

$env:ANTHROPIC_AUTH_TOKEN="ollama"
$env:ANTHROPIC_API_KEY=""
$env:ANTHROPIC_BASE_URL="http://localhost:11434"

Estos ajustes le dicen a Claude Code que use tu instancia local de Ollama en lugar de la API en la nube de Anthropic.

5. Lanza Claude Code

Con esas variables de entorno definidas, arranca Claude Code como siempre:

claude code

Claude Code enviará ahora las peticiones a tu instancia local de Ollama. La primera vez puede tardar entre 10 y 30 segundos en cargar el modelo en la VRAM. Las siguientes peticiones son más rápidas.

Tu primera revisión de código

Con todo en marcha, revisar código se siente natural. Apunta Claude Code a un directorio y pídele que revise un archivo o una funcionalidad concreta:

  • Revisa esta función en busca de problemas de seguridad
  • Comprueba si este código sigue nuestra guía de estilo
  • ¿Cuál es la complejidad temporal de este algoritmo?
  • Refactoriza esto para que se lea mejor

Claude Code puede leer archivos, ejecutar comandos e iterar sobre sus sugerencias. Para revisión de código en concreto, el comando /loop es útil en tareas por lotes — pasar una revisión por varios archivos, comprobar solicitudes de cambios o automatizar análisis repetitivos.

Mantén las expectativas realistas: Los modelos locales destacan generando código, refactorizando y explicando código existente. Son suficientes detectando fallos comunes. Son menos finos en razonamiento arquitectónico o de seguridad complejo que Claude (en la nube). Usa lo local para revisiones rápidas y frecuentes; deja las herramientas en la nube para las auditorías de seguridad críticas.

Local frente a nube: las contrapartidas reales

Ejecutar en local no siempre es mejor. Es distinto, con ventajas auténticas y limitaciones reales.

Dónde gana lo local

  • Privacidad completa: tu código se queda en tu máquina.
  • Sin latencia de red para archivos pequeños.
  • Works offline.
  • No per-request billing.

Dónde gana la nube

  • Razonamiento bastante mejor en problemas complejos.
  • Más rápido en archivos muy grandes (los servidores en la nube tienen más recursos).
  • Actualizaciones automáticas; sin gestión manual de modelos.
  • Mejor manejo de casos límite y patrones de código inusuales.

El argumento de la privacidad merece atención específica. Cuando envías código a un servicio en la nube pasan dos cosas: tu petición viaja por la red y el proveedor puede registrarla (para depurar, prevenir abusos o mejorar el modelo). Aunque una empresa afirme que no conserva datos, los patrones que representa tu código quedan aprendidos por el modelo durante el entrenamiento — borrar los archivos originales no borra ese aprendizaje. Para código propietario, secretos industriales o datos regulados, ejecutar en local elimina de verdad esa categoría de riesgo.

Consejos prácticos y trampas habituales

La cuantización afecta a la calidad

Ollama descarga modelos cuantizados por defecto. Un modelo de 7B con cuantización Q4_K_M usa unos 4-5 GB de VRAM; el mismo modelo a precisión completa de 16 bits necesita 14 GB. Pierdes algo de precisión de razonamiento, pero normalmente no lo suficiente para que importe en una revisión de código. Si la calidad baja, prueba variantes de mayor precisión (busca las etiquetas :q6 o :q8).

Cargar el modelo lleva su tiempo

La primera inferencia tras reiniciar puede detenerse entre 10 y 30 segundos mientras el modelo se carga en la VRAM. Es normal. Las peticiones siguientes usan el modelo en caché y son mucho más rápidas. Si revisas código a menudo, deja Ollama corriendo en segundo plano.

Las ventanas de contexto importan

Qwen 2.5 Coder tiene una ventana de contexto de 32K; GLM 4.7 Flash, de 128K. Para archivos grandes o revisiones de muchos archivos, una ventana mayor ayuda al modelo a «ver» más código de una vez. Si revisas bases de código enormes, plantéate la variante de 32B de Qwen o GLM.

Ajustes de temperatura

Para revisar código, una temperatura baja (más determinista) suele ir mejor que una alta. Claude Code trae valores razonables por defecto, pero si las respuestas se sienten demasiado creativas o inestables, revisa tu configuración local.

Preguntas frecuentes

¿Puedo usar Claude Code con Ollama sin la API de Anthropic?

Sí. Ese es justo el sentido de esta configuración. Ollama implementa el formato de API de Anthropic, así que Claude Code lo trata como un sustituto directo. No hace falta cuenta ni clave de API de Anthropic.

¿Y si mi GPU se queda corta para Qwen 7B?

Baja a modelos más pequeños como Mistral 7B u Orca Mini (3B). Son menos capaces pero siguen sirviendo para una revisión básica. Como alternativa, ejecuta solo con CPU (mucho más lento) o usa descarga por capas si tu controlador de GPU lo permite.

¿Puedo cambiar de modelo sobre la marcha?

Sí. Si tienes varios modelos descargados, puedes indicar cuál usa Ollama mediante variables de entorno o parámetros de línea de comandos. Consulta la documentación de Ollama para la sintaxis exacta. En la práctica, la mayoría se queda con un buen modelo para evitar el coste de ir cambiando de contexto.

¿Es la revisión local segura frente a la extracción de código?

Más segura que la nube, sí. Un LLM local no puede sacar tu código por la red. Pero, como todo modelo de aprendizaje automático, aprende patrones de lo que ve. Alguien con acceso a tu máquina podría extraer los pesos o examinar los estados internos del modelo para deducir la estructura del código. Para código realmente sensible (claves criptográficas, algoritmos de seguridad), la revisión debería seguir siendo manual o hacerse en entornos aislados por hardware.

¿Y ejecutar Ollama en otra máquina?

Puedes. Ollama admite conexiones de red. Configura ANTHROPIC_BASE_URL para que apunte a la IP y el puerto de la máquina remota. Es útil si quieres un servidor con GPU potente y máquinas cliente más ligeras. Eso sí, la latencia de red aumenta.

Por dónde seguir

Cuando te sientas cómodo con la configuración básica, plantéate:

  • Configurar Ollama como servicio del sistema para que arranque solo.
  • Experimentar con varios modelos y comparar la calidad de su revisión de código.
  • Crear instrucciones o plantillas de revisión a medida para la guía de estilo de tu equipo.
  • Ejecutar Ollama en un servidor con GPU compartido si trabajas con más gente.

La cadena de herramientas de revisión de código en local ya es práctica para trabajo de desarrollo serio. No sustituirá a la revisión humana, pero es una primera pasada capaz y está por completo bajo tu control.