8 septiembre 2026 EN ES
Small and Owned

Build small, own everything, live well

Automatizar

Ejecuta un LLM local de 104 GB en un Mac de 48 GB para automatización privada de costo fijo

Una lista de verificación serena de margen para automatización privada de modelos de costo fijo en un Mac, sin convertirte en ingeniero de ML.

Illustration: Run a 104GB Local LLM on a 48GB Mac for Private, Fixed-Cost Automation

El caso silencioso de poseer inferencia

No necesitas un centro de datos para mantener privadas tus notas, borradores y flujos de trabajo internos. Necesitas una mejor decisión de margen. Un modelo local en un Mac puede ser el truco duradero: sin facturación por token, sin rastro externo de prompts y con una máquina que ya posees. El inconveniente es que la inferencia local no es una versión más rápida de la nube. Es una versión más lenta, más estrecha y más predecible. Si aceptas eso, puede convertirse en la columna vertebral serena de una empresa de una sola persona.

La pregunta de primeros principios no es si el modelo es impresionante. Es si el trabajo merece las horas. Si la tarea es privada, procesable por lotes y poco dependiente de prompts, la inferencia local puede ahorrarte alquilar inteligencia para cada pequeña decisión. Si la tarea necesita respuestas rápidas, contexto largo, uso de herramientas o salida estructurada pulida, la nube puede seguir siendo la mejor herramienta. El margen no está en el modelo. Está en elegir el trabajo adecuado para la máquina que ya tienes.

Por eso, la configuración debe sentirse menos como un truco de crecimiento y más como un límite. No intentas reemplazar cada llamada de API. Intentas poseer una pequeña capa privada de automatización que no filtre tu trabajo, no te sorprenda con tarifas de uso y no te obligue a convertirte en ingeniero de aprendizaje automático. El objetivo es un endpoint silencioso en el que puedes confiar para los trabajos que encajan en él.

La lista de verificación de margen de inferencia local

Realiza esta lista de verificación antes de dedicar tiempo a la configuración. Si la respuesta a algún elemento es no, la vía local probablemente no sea el margen adecuado para ese trabajo.

  1. Usa la vía local solo cuando el trabajo sea privado, procesable por lotes y poco dependiente de prompts. Si el trabajo es público, urgente o con mucho contexto, déjalo en la nube.
  2. Requiere Apple Silicon, macOS 14+ y unos 110 GB de disco libre, con un Mac de 512 GB como mínimo realista.
  3. El modelo ocupa 104 GB en disco a 4-bit y transmite pesos desde SSD.
  4. El límite automático de memoria es de 33 GB, y un Mac de 128 GB recibe el mismo plan que un Mac de 48 GB.
  5. Un prompt de 8.000 tokens tarda aproximadamente un minuto en un Mac de 48 GB antes de que aparezca el primer token.
  6. Evita herramientas, imágenes, salida JSON-schema y logprobs; el subconjunto de API devuelve un 400 claro para ellos.
  7. Expón las APIs de chat de Ollama o OpenAI desde un único binario Swift sin Python.
  8. Mide el tiempo hasta el primer token y los tokens por segundo antes de automatizar. Si los números no encajan con el flujo de trabajo, no automatices todavía.

Mantén el margen después de la configuración

Una vez que el endpoint esté en marcha, trátalo como un pequeño servicio interno, no como un asistente mágico. Dale un trabajo a la vez. Resume un lote de notas. Redacta un memorando privado. Extrae una lista de un documento. Clasifica una bandeja de entrada. Reescribe un párrafo con tu propia voz. Las mejores automatizaciones locales son aburridas, repetibles y fáciles de inspeccionar. Si tienes que perseguir una alucinación, depurar un esquema o esperar una llamada a herramienta, el trabajo puede ser demasiado grande para la vía local.

Mide antes de automatizar. Ejecuta el mismo prompt varias veces y anota cuánto tarda el primer token y a qué velocidad se transmite la respuesta. Si la espera es aceptable para un trabajo por lotes, mantenlo local. Si te hace revisar el teléfono, mueve el trabajo a otro lugar. El punto no es demostrar que un Mac puede ejecutar un modelo grande. El punto es construir una capa privada y de costo fijo que te ahorre horas sin robarte la atención.

Finalmente, mantén el límite visible. Un LLM local no es una razón para dejar de usar herramientas mejores. Es una razón para elegir con más deliberación. Cuando el trabajo es privado y el ritmo es lento, posee la inferencia. Cuando el trabajo es público, rápido o complejo, alquila la capacidad. Ese es el margen: menos piezas móviles, menos fugas, menos sorpresas y una máquina que hace el trabajo silencioso mientras tú haces el trabajo que solo tú puedes hacer.

No dejes que la configuración se convierta en un pasatiempo. La máquina debe servir al negocio, no al revés. Si una automatización local te ahorra una pequeña cantidad de tiempo y mantiene privado tu trabajo, ha merecido su lugar. Si crea un segundo sistema que vigilar, no lo ha hecho.

Publicidad