Cómo debe usar un agente los planes FlatCompute
Este documento es común a todas las integraciones. Su objetivo es maximizar el trabajo útil sin crear tormentas de peticiones, reintentos o subagentes.
Perfil actual de planes
| Plan | Solicitudes LLM activas | En cola | Contexto máximo | API keys |
|---|---|---|---|---|
| Starter | 1 | 3 | 64K | 1 |
| Builder | 2 | 6 | 128K | 3 |
| Pro | 4 | 12 | 256K | 5 |
| Enterprise | 12 | 36 | 256K | Ilimitadas |
La fuente definitiva debe ser siempre la información devuelta por el panel o por una futura ruta de capacidades. La documentación descargable debe generarse con los valores actuales del usuario.
Reglas de uso
- La suma de peticiones LLM simultáneas no debe superar los slots activos del plan.
- No lanzar subagentes en paralelo por defecto. Paralelizar solo tareas realmente independientes.
- Ante
429,503, timeout o desconexión de stream, respetarRetry-Aftercuando exista y usar backoff exponencial con jitter. - Máximo recomendado: 2 reintentos automáticos por operación. No crear bucles infinitos.
- Usar streaming para tareas largas.
- Mantener estable el prompt de sistema, las herramientas y su orden para favorecer el prefix cache.
- Reutilizar una sesión cuando sea razonable, pero compactar o iniciar otra antes de llegar al límite de contexto.
- No enviar todo el repositorio en cada turno. Preferir búsqueda, mapas del repositorio y lectura selectiva.
- Separar “planificar” de “ejecutar” en trabajos grandes: primero una llamada corta para producir el plan y después ejecutar por lotes.
- No usar el contexto máximo como objetivo. Es un techo, no una recomendación de consumo.
Concurrencia recomendada
Starter: 1 petición LLM simultánea
Builder: hasta 2
Pro: hasta 4
Enterprise: hasta 12
Cuando una herramienta mezcla llamadas LLM con herramientas locales, solo las llamadas al modelo consumen slots. Aun así, limitar la concurrencia global evita que varios subagentes terminen sus lecturas a la vez y generen una ráfaga de inferencia.
Comprobación mínima
Antes de iniciar una tarea real:
- Comprobar autenticación con
GET <FLATCOMPUTE_BASE_URL>/models. - Ejecutar una generación de 1–8 tokens.
- Confirmar el modelo exacto y el contexto configurado.
- Confirmar que una clave no aparece en logs, archivos de proyecto ni control de versiones.