Moteur de recherche d'offres d'emploi STELLANTIS

Stage : Ingénieur benchmarking des grands modèles de langage


Détail de l'offre

Informations générales

Entité de rattachement

Nous rejoindre, c'est intégrer une entreprise d'envergure mondiale. Mû par la recherche permanente de l'innovation et de l'excellence, pionnier et leader des technologies propres et de la mobilité durable, le Groupe entend rester à la pointe des grandes tendances qui font bouger le monde.

Fort de son efficience, de son agilité et de son esprit d'équipe, le Groupe fait preuve d'exigence et d'audace pour définir la mobilité de demain.

Pour réussir ces transformations, l'entreprise a besoin de tous les talents. Rejoignez-nous !

Chez Stellantis, nous évaluons les candidats selon leurs qualifications, leurs mérites et les besoins du métier. Nous accueillons les candidatures des personnes de tout genre, âge, ethnie, nationalité, religion, orientation sexuelle, et handicap. La diversité de nos équipes nous permettra de mieux appréhender l'évolution des besoins de nos clients et de notre environnement futur.  

Référence

2026-20053  

Description du poste

Filière/Métier

ICT, Digital & Data - ICT, Digital & Data

Intitulé du poste

Stage : Ingénieur benchmarking des grands modèles de langage

Contrat

Stage

Description de la mission

Vous intégrerez l'équipe l'IT qui accompagne les activités de Qualité et de Planification du Développement Produit chez Stellantis.

L'équipe intervient dans le développement logiciel, la gestion des connaissances d'ingénierie, la qualité, la planification des programmes & la productivité individuelle. La disponibilité croissante des grands modèles de langage nécessite une méthode objective &reproductible permettant d'évaluer leur adéquation aux cas d'usage métier réels.

L'objectif de ce stage est de concevoir &de mettre en œuvre une solution de benchmarking comparant des grands modèles de langage à partir de cas de test représentatifs recueillis auprès des équipes Qualité & Planification du Développement Produit.

Il consistera à créer une solution de benchmarking structurée & reproductible afin d'évaluer les grands modèles de langage sur des cas d'usage réels de Qualité & de Planification du Développement Produit.
- Identifier les principales parties prenantes et équipes impliquées
- Définir un modèle standard pour recueillir les cas d'usage métier et techniques.
- Organiser des entretiens et ateliers afin de comprendre les besoins, processus actuels, résultats attendus et critères d'évaluation.
- Recueillir et documenter des cas d'usage couvrant notamment le codage, la recherche de connaissances, l'analyse documentaire, la génération de contenu, la productivité, l'analyse de données et l'assistance technique.
- Classer les cas d'usage par domaine thématique, complexité, type de réponse attendu, contexte requis & criticité métier.
- Définir un ensemble représentatif et équilibré de scénarios de benchmark.
- Transformer les cas d'usage sélectionnés en cas de test reproductibles exécutables sur différents LLM.
-Préparer pour chaque cas de test les entrées de référence, les consignes d'évaluation, les résultats attendus &les critères d'acceptation.
-Définir des modèles de notation thématiques couvrant la précision, l'exhaustivité, la pertinence, la qualité du raisonnement, le respect des consignes, le format de sortie, la fiabilité &la cohérence.
-Définir les pondérations thématiques et une note globale du modèle, en distinguant l'évaluation automatique de l'évaluation humaine structurée.
-Mettre en œuvre, lorsque cela est possible, un cadre automatisé pour soumettre les cas de test et recueillir les réponses des modèles.
-Mesurer la latence, le délai avant le premier token, la vitesse de génération, le débit et le taux d'échec.
-Mesurer la consommation de tokens en entrée et en sortie et calculer le coût de chaque cas de test et domaine thématique.
-Effectuer des exécutions répétées afin d'évaluer la stabilité et la reproductibilité.
-Comparer les modèles selon la qualité, les performances, la consommation de tokens, le coût et l'adéquation à chaque catégorie de cas d'usage.
-Créer des rapports et tableaux de bord visuels, documenter la méthodologie et presenter des recommandations aux parties prenantes

Profil

Livrables :
Catalogue structuré des cas d'usage.
Taxonomie des cas d'usage couvrant les domaines thématiques identifiés.
Bibliothèque de cas de test de benchmark documentés &reproductibles.
Cadre de notation pour chaque domaine thématique ¬e globale pondérée.
Solution de benchmarking automatisée ou semi-automatisée.
Rapport comparatif des modèles couvrant la qualité, les performances, la consommation de tokens &le coût.
TDB ou visualisation structurée des résultats du benchmark.
Documentation utilisateur &maintenance
Recommandation finale identifiant les modèles les plus adaptes par catego de cas d'usage

Vous préparez un Master ou diplôme d'ingénieur en dernière année en informatique, IA, science des données, génie logiciel, génie industriel, analytique métier ou dans un domaine connexe.

Vous associez curiosité technique, méthode &sens de l'utilisateur. Vous êtes à l'aise pour recueillir des besoins, transformer des attentes métier en cas de test mesurables et communiquer avec des interlocuteurs techniques/non techniques. Vous faites preuve d'analyse, d'écoute active, rigueur, d'esprit de collaboration &d'attention aux détails.

Compétences requises :
• Solides capacités d'analyse et de résolution de problèmes.
• Compréhension de base des LLM et de l'IA générative.
• Capacité à traduire les besoins métier en exigences techniques et cas de test.
• Connaissance de Python ou d'un autre langage de script approprié.
• Capacité à recueillir, traiter et comparer des données quantitatives.
• Connaissance de base de l'analyse statistique et des indicateurs de performance.
• Capacité à définir des critères d'évaluation et des méthodes de notation clairs.
• Excellentes compétences rédactionnelles et de documentation technique.
• Capacité à collaborer entre domaines métier et techniques.

Compétences souhaitées :
• Expérience en tests logiciels, assurance qualité ou conception de benchmarks.
• Connaissance des cadres d'évaluation des LLM.
• Connaissance de la conception de prompts &de l'évaluation structurée des modèles.
• Expérience des API et de l'exécution automatisée de tests.
• Connaissance des outils d'analyse &de visualisation de données.
• Connaissance des métriques de similarité sémantique &de qualité du texte.
• Expérience des protocoles d'évaluation humaine &des consignes de notation.
• Connaissance de base des services d'IA dans le cloud.
• Compréhension de la comptabilisation des tokens &de la tarification à l'usage.
• Expérience des entretiens avec les parties prenantes &du recueil des besoins.

Chez Stellantis, nous évaluons les candidats selon leurs qualifications, leurs mérites et les besoins du métier. Nous accueillons les candidatures des personnes de tout genre, âge, ethnie, nationalité, religion, orientation sexuelle, et handicap. La diversité de nos équipes nous permettra de mieux appréhender l'évolution des besoins de nos clients et de notre environnement futur.

Durée du contrat

6 mois

Localisation du poste

Pays

Europe, France, Franche-Comté, Doubs (25)

Ville

Sochaux

Critères candidat

Niveau de diplôme préparé

Bac+5

Langues

Anglais (B2 - Intermédiaire (2,5 - 3,4 Bright))