Saltearse al contenido

Formato de la respuesta

Semantara devuelve las respuestas en el formato de OpenAI. Tu código existente las procesa sin cambios.

{
"id": "chatcmpl-...",
"object": "chat.completion",
"created": 1700000000,
"model": "gpt-4o-mini",
"choices": [
{
"index": 0,
"message": { "role": "assistant", "content": "..." },
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 24,
"completion_tokens": 112,
"total_tokens": 136
}
}

El contenido está en choices[0].message.content. El campo model refleja el modelo que resolvió la petición realmente — útil con proxy/auto, donde el enrutamiento elige por ti.

finish_reason

Indica por qué terminó la generación:

ValorSignificado
stopEl modelo terminó de forma natural.
lengthSe alcanzó el tope de max_tokens. La respuesta quedó cortada — sube max_tokens si necesitas más. Ver Parámetros.

usage

usage trae el conteo real de tokens de tu proveedor: prompt_tokens, completion_tokens y total_tokens.

Sin campos adicionales

La respuesta es OpenAI-compat pura: Semantara no agrega campos ni headers propios al cuerpo. La información de caché y de ahorro vive en la Consola, no en la respuesta.