llmfit: la herramienta de terminal que te dice qué LLM corre bien en tu máquina

Actualizado: 20/08/26 12:26

Creado: 20/08/26 12:26

Si alguna vez has intentado correr un modelo de lenguaje en local sabrás el problema: hay cientos de modelos disponibles, docenas de niveles de cuantización, y ninguna forma sencilla de saber cuáles va a aguantar tu máquina sin quedarse sin memoria a mitad de la respuesta. llmfit es una herramienta de terminal, escrita en Rust, que resuelve exactamente eso: detecta tu hardware y te dice qué modelos vas a poder correr bien, y con qué cuantización.

¿Qué problema resuelve?

Elegir un modelo local suele ser prueba y error: descargas uno, lo cargas en Ollama o llama.cpp, y descubres a mitad de proceso que tu RAM o tu VRAM no dan para más. llmfit se salta ese ensayo y error analizando tu CPU, tu RAM y tu GPU/VRAM, y puntuando cada modelo disponible según calidad, velocidad, ajuste de memoria y ventana de contexto. El resultado es una tabla ordenada de «esto sí corre bien en tu máquina, esto no».

Cómo funciona

Por defecto se abre como una TUI (interfaz de terminal interactiva) que muestra tus specs detectadas arriba y, debajo, cada modelo puntuado por ajuste, velocidad, calidad y contexto. También tiene un modo CLI clásico pensado para scripts y agentes, con salida en JSON. Soporta configuraciones multi-GPU, arquitecturas MoE (Mixture of Experts), selección dinámica de cuantización, y se integra con los runtimes locales más habituales: Ollama, llama.cpp, MLX, LM Studio y Docker Model Runner.

Una función interesante es el benchmarking comunitario: puedes descargar un modelo, servirlo, medir los tokens por segundo reales en tu hardware, y contribuir esos números de vuelta al proyecto mediante un PR generado desde la propia TUI. Así, las estimaciones del proyecto dejan de ser teóricas y se sustituyen poco a poco por medidas reales de gente con hardware parecido al tuyo.

Instalación

Está disponible para macOS, Linux y Windows por varias vías. Con Homebrew:

brew install llmfit

En Windows con Scoop, o directamente con uv/pip si prefieres el ecosistema Python:

scoop install llmfit
uv tool install -U llmfit

También hay imagen Docker para integrarlo en pipelines sin instalar nada:

docker run ghcr.io/alexsjones/llmfit

Uso básico

Ejecutado sin argumentos, abre la TUI interactiva:

llmfit

Para uso en scripts o agentes, el modo CLI clásico:

llmfit fit                    # tabla de todos los modelos ordenados por ajuste
llmfit recommend --json       # mejores opciones en JSON, para consumo de scripts/agentes
llmfit info "<modelo>"        # análisis de ajuste de un modelo concreto
llmfit bench                  # mide tok/s y TTFT reales contra tu runtime
llmfit doctor                 # informe de detección de hardware, útil para bug reports

Características destacadas

  • Detección automática de CPU, RAM y GPU/VRAM, incluidos setups multi-GPU
  • Soporte para arquitecturas MoE y selección dinámica de cuantización
  • Integración con Ollama, llama.cpp, MLX, LM Studio y Docker Model Runner
  • Modo TUI interactivo y modo CLI con salida JSON para automatización
  • Benchmarking comunitario: mide y contribuye rendimiento real desde la propia herramienta

Estado del proyecto

Lo mantiene AlexsJones y es sorprendentemente popular para lo joven que es: nació en febrero de 2026 y a día de hoy acumula más de 33.000 estrellas en GitHub, más de 2.000 forks y por encima de 1.100 commits, con actividad reciente constante. Licencia MIT, código en Rust, y binarios firmados con SignPath.

Hundreds of models & providers. One command to find what runs on your hardware.

Si trabajas con modelos locales y estás cansado de adivinar qué vas a poder correr, merece la pena probarlo. El repositorio está en github.com/AlexsJones/llmfit, y la documentación completa en llmfit.org.