Cómo funciona
Semantara no cambia lo que tu aplicación pide; cambia cómo se resuelve para que cueste menos. Cada petición pasa por tres mecanismos.
Caché semántico
El caché está en fase de calibración: registra qué peticiones podrían servirse desde caché, pero todavía no sirve respuestas en producción. Es deliberado: servimos solo lo verificablemente correcto — una respuesta rápida pero equivocada es peor que una llamada de más. La equivalencia semántica verificada es la siguiente fase; cuando se active, el ahorro aparecerá en tu Consola sin que cambies nada.
El alcance del caché se configura por API key, y determina qué tan compartida es una respuesta:
- Deshabilitado — no se cachea nada para esa key.
- Público — respuestas comunes se comparten entre clientes (máximo ahorro para preguntas genéricas).
- Privado por cliente — el caché es tuyo, compartido entre todas tus keys.
- Privado por key — el caché queda aislado a esa key específica.
Los planes de nivel superior desbloquean alcances más privados. El aislamiento entre clientes está garantizado: una respuesta privada nunca se filtra a otro cliente.
Enrutamiento automático
Con model: "proxy/auto", Semantara elige el modelo por ti. Cómo lo elige depende de la
configuración de tu API key:
- Key con un solo proveedor conectado (OpenAI o Anthropic) → se sirve un modelo base fijo y aprobado para ese proveedor. Predecible y estable: sin un paso de análisis previo que añada latencia o costo.
- Key con proveedor principal y de respaldo → enrutamiento clásico, que clasifica la petición y elige dentro del catálogo de tu proveedor.
Si prefieres control total, especifica el modelo a mano y Semantara lo respeta exactamente.
Si el modelo base de tu proveedor no está disponible en ese momento, la petición falla con
un error explícito (LLM_013) en lugar de servirte otro modelo en silencio.
Tus claves, con respaldo (BYOK + failover)
Usas tus propias claves de proveedor (BYOK), cifradas en reposo. Puedes asignar a cada API key un proveedor principal y uno de respaldo: si el principal falla, Semantara reintenta con el respaldo automáticamente, sin que tu aplicación se entere.
Conectar un respaldo cambia también cómo se resuelve proxy/auto: una key con dos
proveedores usa el enrutamiento clásico, no el modelo base fijo. Es la contrapartida de
tener respaldo, y la eliges tú al configurar la key.
El failover automático aplica a peticiones sin streaming. En streaming, la petición usa el proveedor principal; si falla, recibes el error y reintentas desde tu aplicación.
Proveedores disponibles: OpenAI, Anthropic y Gemini. Dos matices sobre Gemini:
el modelo base fijo del enrutamiento automático no está habilitado para él —sus peticiones
proxy/auto usan el enrutamiento clásico— y no admite streaming.
Qué mides
Cada respuesta registra su costo real —tokens y USD, por día y por key— en la Consola. Es el número que puedes conciliar contra la factura de tu proveedor.
Cuando la petición fija un modelo concreto, o cuando se resuelve por enrutamiento clásico, la Consola muestra además una comparación de costo contra el modelo de referencia de tu proveedor. Con el modelo base fijo no mostramos esa comparación: sería un contraste contra un modelo que el enrutamiento ya no puede elegir, y preferimos no publicar un ahorro que no podemos sostener. En su lugar, el ahorro de ese camino está en el precio del propio modelo base y en no pagar un paso de análisis por petición.