Passer au contenu principal
Certains modèles réfléchissent à voix haute avant de répondre. Ils résolvent les problèmes étape par étape, puis fournissent une réponse finale. Cela les rend plus performants pour les mathématiques, le code et les tâches de logique exigeante.
Consultez la liste complète des modèles, des tarifs et des limites de contexte sur la page Modèles. Tous les modèles de raisonnement ne prennent pas en charge le paramètre reasoning_effort. Voir la prise en charge des modèles pour plus de détails.

Lire la sortie

Les modèles de raisonnement renvoient leur chaîne de pensée dans un champ reasoning_content distinct, ce qui garde content propre :
Certains fournisseurs (Anthropic, Google, OpenAI, Qwen) renvoient des tokens de raisonnement chiffrés ou résumés. Dans ce cas, reasoning_content contient un substitut "[Some reasoning content is encrypted]".

Streaming

En mode streaming, reasoning_content arrive dans le delta avant la réponse finale :

Effort de raisonnement

Le paramètre reasoning_effort contrôle à quel point le modèle réfléchit avant de répondre. Un effort plus élevé signifie un raisonnement plus profond, mais davantage de tokens et de latence.

Valeurs acceptées

Tous les modèles ne prennent pas en charge toutes les valeurs. Venice ne mappe pas automatiquement au niveau pris en charge le plus proche. Les valeurs non prises en charge renvoient une erreur 400 du fournisseur en amont. Par exemple, envoyer xhigh à Claude ou max à GPT-5.2 échouera.En cas de doute, utilisez low, medium ou high. Ce sont les valeurs les plus largement prises en charge.

Prise en charge des modèles

OpenAI

Anthropic

Google

xAI

Les modèles Grok (Grok 4.1 Fast, Grok Code Fast) ne prennent pas en charge reasoning_effort. Le spécifier entraînera une erreur.

Autres modèles

Utilisation

Passez reasoning_effort comme paramètre de premier niveau ou utilisez le format imbriqué reasoning.effort :
Le format plat "reasoning_effort": "high" est également accepté.

Désactiver le raisonnement

Il existe deux façons de désactiver le raisonnement : Pour les modèles qui le prennent en charge, reasoning.enabled: false est l’option la plus fiable :

Limites de tokens

Les modèles de raisonnement génèrent des tokens de réponse visibles (dans content) et des tokens de raisonnement (dans reasoning_content). Les deux sont comptabilisés dans votre budget de tokens.

Définir un plafond de tokens

Utilisez max_completion_tokens pour plafonner le nombre total de tokens que le modèle génère, raisonnement compris :
max_tokens est également accepté et se comporte de la même manière. Si les deux sont définis, max_completion_tokens prend la priorité. Pour obtenir plus de sortie visible, augmentez le plafond, abaissez reasoning_effort, ou désactivez le raisonnement.

Lire le détail

L’objet usage montre comment votre budget a été dépensé :
Dans cet exemple, 169 tokens ont été consacrés au raisonnement et 332 à la réponse visible. Lorsque le plafond est atteint, finish_reason vaut length. La limite supérieure de chaque modèle est disponible sous maxCompletionTokens sur l’endpoint /v1/models.

Modèles sans raisonnement

max_tokens et max_completion_tokens se comportent de la même manière sur les modèles sans raisonnement, en plafonnant directement la sortie visible.

Découverte des capacités

Vérifiez ce qu’un modèle prend en charge via l’endpoint /v1/models :

Bonnes pratiques

  • Utilisez medium par défaut pour un usage général
  • Utilisez high ou xhigh pour les tâches complexes (mathématiques, code, analyse)
  • Utilisez low pour les applications sensibles à la latence
  • Utilisez reasoning.enabled: false ou définissez l’effort à none pour désactiver le raisonnement
  • En cas de doute, utilisez low, medium ou high. Ce sont les valeurs les plus largement prises en charge