SHARED POLICY

FlatCompute agent usage policy

Cómo debe usar un agente los planes FlatCompute

Este documento es común a todas las integraciones. Su objetivo es maximizar el trabajo útil sin crear tormentas de peticiones, reintentos o subagentes.

Perfil actual de planes

Plan Solicitudes LLM activas En cola Contexto máximo API keys
Starter 1 3 64K 1
Builder 2 6 128K 3
Pro 4 12 256K 5
Enterprise 12 36 256K Ilimitadas

La fuente definitiva debe ser siempre la información devuelta por el panel o por una futura ruta de capacidades. La documentación descargable debe generarse con los valores actuales del usuario.

Reglas de uso

  1. La suma de peticiones LLM simultáneas no debe superar los slots activos del plan.
  2. No lanzar subagentes en paralelo por defecto. Paralelizar solo tareas realmente independientes.
  3. Ante 429, 503, timeout o desconexión de stream, respetar Retry-After cuando exista y usar backoff exponencial con jitter.
  4. Máximo recomendado: 2 reintentos automáticos por operación. No crear bucles infinitos.
  5. Usar streaming para tareas largas.
  6. Mantener estable el prompt de sistema, las herramientas y su orden para favorecer el prefix cache.
  7. Reutilizar una sesión cuando sea razonable, pero compactar o iniciar otra antes de llegar al límite de contexto.
  8. No enviar todo el repositorio en cada turno. Preferir búsqueda, mapas del repositorio y lectura selectiva.
  9. Separar “planificar” de “ejecutar” en trabajos grandes: primero una llamada corta para producir el plan y después ejecutar por lotes.
  10. No usar el contexto máximo como objetivo. Es un techo, no una recomendación de consumo.

Concurrencia recomendada

Starter:    1 petición LLM simultánea
Builder:    hasta 2
Pro:        hasta 4
Enterprise: hasta 12

Cuando una herramienta mezcla llamadas LLM con herramientas locales, solo las llamadas al modelo consumen slots. Aun así, limitar la concurrencia global evita que varios subagentes terminen sus lecturas a la vez y generen una ráfaga de inferencia.

Comprobación mínima

Antes de iniciar una tarea real:

  1. Comprobar autenticación con GET <FLATCOMPUTE_BASE_URL>/models.
  2. Ejecutar una generación de 1–8 tokens.
  3. Confirmar el modelo exacto y el contexto configurado.
  4. Confirmar que una clave no aparece en logs, archivos de proyecto ni control de versiones.

← back to docs
FlatCompute Agent Usage Policy — Docs