Caso de estudio
Local AI Coding Agent
Un agente de programación para modelos locales.
Un runtime de programación con agentes para modelos locales de pesos abiertos, con herramientas revisables, contexto acotado y supervisión humana.
Prototipo local privado. Arquitectura seleccionada y alcance de evaluación públicos.
Arquitectura e implementación independiente en TypeScript: núcleo del agente, gateway de modelos, compilador de contexto, herramientas, permisos y evaluación.
Resumen del caso
El brief estratégico
El problema, la respuesta del sistema, la prueba disponible, el valor estratégico y el límite intencional.
- 01Problema
- Los modelos locales necesitan más que un chat para inspeccionar repositorios, reunir evidencia y recuperarse de llamadas a herramientas sin progreso.
- 02Sistema
- Runtime TypeScript independiente del editor con gateway local, contexto acotado, herramientas de repositorio, permisos y reparación controlada.
- 03Prueba
- Corpus documentado de 24 tareas de solo lectura y una base separada de 30 casos deterministas de programación. Evalúan partes distintas del sistema.
- 04Valor
- Permite revisar el desarrollo asistido por IA local a través de las herramientas elegidas, la evidencia, los cambios y la verificación.
- 05Límite
- Prototipo, no asistente de programación en producción. Las pruebas deterministas no demuestran fiabilidad del modelo en vivo; la integración IDE está prevista.
01
Dar al modelo una tarea acotada
El proyecto separa inspección, planificación, diagnóstico y modificación. La respuesta del modelo es un paso del proceso: el runtime también necesita saber qué evidencia se reunió, qué herramientas pueden ejecutarse y cuándo detener la tarea.
02
Un runtime independiente del editor
El núcleo TypeScript conecta un compilador de contexto y memoria Markdown con un bucle de agente limitado por turnos. Un gateway normaliza llamadas del modelo; las herramientas del repositorio devuelven observaciones acotadas. Los permisos controlan cambios y verificación. Un endpoint local compatible con OpenAI permite inferencia con modelos de pesos abiertos; Qwen 2.5 Coder 7B se evaluó mediante Ollama.
03
Evaluar modelo y runtime por separado
El corpus de solo lectura tiene 24 tareas: 20 de desarrollo y cuatro reservadas, sobre orientación en repositorios, símbolos, configuración, diagnóstico de tests y razonamiento entre archivos. Se investigaron contextos de 2.048, 8.192 y 32.768 tokens. Otra base de 30 casos deterministas prueba cambios, verificación y rechazo seguro. Los resúmenes discrepan en éxito y selección de herramientas, por lo que aquí no se publica una cifra agregada de rendimiento.
04
Hacer visible el fallo
Los límites de turnos, la detección de bucles, el registro de evidencia y la validación antes de responder acotan la falta de progreso. Los cambios usan parches revisados y comprobación del hash de origen; verificación y reparación tienen límites y aprobación humana. Son mecanismos implementados, no una garantía de éxito para cada tarea del modelo.
05
Inferencia local, límites explícitos
El caso público muestra arquitectura seleccionada sin exponer el entorno privado. La CLI y el runtime están implementados; la integración IDE está prevista. Las pruebas con fixtures deterministas se distinguen de la inferencia en vivo. No se afirma adopción en producción, éxito general de programación ni latencia comparativa.