llama.cpp (Motor de Inferencia Local)

La tecnología fundamental que hace posible la IA local de alto rendimiento.

llama.cpp, creado por Georgi Gerganov, es una librería de inferencia escrita en C/C++ puro. Su objetivo es ejecutar LLMs (como Llama 3, Mistral, Gemma) en hardware común (CPU) con una eficiencia sin precedentes, gracias a la técnica de cuantización (reducir la precisión de los pesos del modelo para que ocupen menos RAM). Es la columna vertebral que permite que tu ordenador ejecute IA sin necesidad de costosas GPUs de servidor.

📋 Detalles Técnicos

Característica Especificación
Lenguaje: C/C++
Formato nativo: GGUF (GPT-Generated Unified Format)
Aceleración: AVX, Metal (Apple), CUDA, OpenCL
Licencia: MIT (Open Source)

🚀 ¿Por qué es la pieza clave?

  • Cuantización: Permite pasar un modelo de 16-bits a 4-bits o 2-bits, reduciendo el consumo de RAM hasta 4-8 veces con una pérdida de inteligencia mínima.
  • Portabilidad: Funciona en casi cualquier arquitectura: desde procesadores Apple M1/M2/M3 hasta procesadores Intel de hace 10 años, pasando por Raspberry Pi y teléfonos Android.
  • Interfaz de Servidor: Incluye un servidor web básico compatible con la API de OpenAI, facilitando su uso como backend para cualquier otra aplicación.

Repositorio del Proyecto

Acceso al código fuente oficial.

Nota: Si eres un usuario avanzado, puedes compilarlo desde el código fuente para obtener la máxima optimización específica para tu procesador (usando SIMD instructions).

Scroll al inicio