reasoning_effort. Voir la prise en charge des modèles pour plus de détails.
Lire la sortie
Les modèles de raisonnement renvoient leur chaîne de pensée dans un champreasoning_content distinct, ce qui garde content propre :
Certains fournisseurs (Anthropic, Google, OpenAI, Qwen) renvoient des tokens de raisonnement chiffrés ou résumés. Dans ce cas,
reasoning_content contient un substitut "[Some reasoning content is encrypted]".Streaming
En mode streaming,reasoning_content arrive dans le delta avant la réponse finale :
Effort de raisonnement
Le paramètrereasoning_effort contrôle à quel point le modèle réfléchit avant de répondre. Un effort plus élevé signifie un raisonnement plus profond, mais davantage de tokens et de latence.
Valeurs acceptées
Prise en charge des modèles
OpenAI
Anthropic
xAI
Les modèles Grok (Grok 4.1 Fast, Grok Code Fast) ne prennent pas en chargereasoning_effort. Le spécifier entraînera une erreur.
Autres modèles
Utilisation
Passezreasoning_effort comme paramètre de premier niveau ou utilisez le format imbriqué reasoning.effort :
"reasoning_effort": "high" est également accepté.
Désactiver le raisonnement
Il existe deux façons de désactiver le raisonnement :
Pour les modèles qui le prennent en charge,
reasoning.enabled: false est l’option la plus fiable :
Limites de tokens
Les modèles de raisonnement génèrent des tokens de réponse visibles (danscontent) et des tokens de raisonnement (dans reasoning_content). Les deux sont comptabilisés dans votre budget de tokens.
Définir un plafond de tokens
Utilisezmax_completion_tokens pour plafonner le nombre total de tokens que le modèle génère, raisonnement compris :
max_tokens est également accepté et se comporte de la même manière. Si les deux sont définis, max_completion_tokens prend la priorité.
Pour obtenir plus de sortie visible, augmentez le plafond, abaissez reasoning_effort, ou désactivez le raisonnement.
Lire le détail
L’objetusage montre comment votre budget a été dépensé :
finish_reason vaut length.
La limite supérieure de chaque modèle est disponible sous maxCompletionTokens sur l’endpoint /v1/models.
Modèles sans raisonnement
max_tokens et max_completion_tokens se comportent de la même manière sur les modèles sans raisonnement, en plafonnant directement la sortie visible.
Découverte des capacités
Vérifiez ce qu’un modèle prend en charge via l’endpoint/v1/models :
Bonnes pratiques
- Utilisez
mediumpar défaut pour un usage général - Utilisez
highouxhighpour les tâches complexes (mathématiques, code, analyse) - Utilisez
lowpour les applications sensibles à la latence - Utilisez
reasoning.enabled: falseou définissez l’effort ànonepour désactiver le raisonnement - En cas de doute, utilisez
low,mediumouhigh. Ce sont les valeurs les plus largement prises en charge