Skip to main content
Lors de la création de flux de travail LLM complexes, vous pouvez avoir besoin de solliciter différents modèles selon la précision, le coût ou la latence des appels. Vous pouvez utiliser Not Diamond pour acheminer les prompts dans ces flux de travail vers le modèle le plus adapté à vos besoins, afin de maximiser la précision tout en réduisant les coûts liés aux modèles.

Premiers pas

Assurez-vous d’avoir créé un compte et généré une clé API, puis ajoutez votre clé API à vos variables d’environnement sous le nom NOTDIAMOND_API_KEY. Créer une clé API À partir de là, vous pouvez

Tracing

Weave s’intègre à la bibliothèque Python de Not Diamond pour journaliser automatiquement les appels d’API. Il vous suffit d’exécuter weave.init() au début de votre flux de travail, puis de continuer à utiliser le fournisseur avec routage comme d’habitude :

Routage personnalisé

Vous pouvez également entraîner votre propre [routeur personnalisé] à partir d’Évaluations, afin de permettre à Not Diamond d’acheminer les prompts en fonction des performances obtenues lors des évaluations pour des cas d’usage spécialisés. Commencez par entraîner un routeur personnalisé :
En réutilisant cet ID de préférence dans n’importe quelle requête model_select, vous pouvez acheminer vos prompts afin de maximiser les performances et de minimiser le coût sur vos données d’évaluation :

Assistance complémentaire

Consultez la docs ou envoyez-nous un message si vous avez besoin d’une aide supplémentaire.