Comment influencer les réponses des LLM ?

Illustration d'un consultant SEO guidant un LLM pour influencer ses réponses
Me suivre sur Google

Découvre les points clés de cet article en cliquant sur une question :

Pose directement ta question sur cet article. Entrée pour envoyer, Maj + Entrée pour aller à la ligne.

Ta question et la réponse sont enregistrées pour améliorer cet article et peuvent être supprimées par l’administrateur. Ne saisis aucune donnée personnelle.

    L'Essentiel :
    Les grands modèles de langage (LLM) connectés au web sélectionnent leurs références à partir de contenus bien structurés, riches en mots-clés pertinents et qui répondent clairement et précisément aux questions posées par les utilisateurs en mode conversationnel. Pour influencer efficacement leurs réponses, il est recommandé d'insérer des signaux directionnels explicites et des séquences textuelles stratégiques (STS), tout en privilégiant une approche éthique axée sur la qualité et l'utilité du contenu.

    Lorsqu'ils sont connectés au web, les grands modèles de langage comme ChatGPT, Google Gemini avec ses AI Overviews ou son AI Mode, Le Chat de Mistral, DeepSeek ou encore Grok, répondent aux questions des internautes en synthétisant du contenu issu de multiples sources qu'ils récupèrent en temps réel sur internet. Mais peut-on influencer leurs réponses pour qu'ils préfèrent citer comme référence un contenu plutôt qu'un autre ? Une partie de la réponse consiste aussi à comprendre comment devenir une source privilégiée de ChatGPT.


    Comprendre le fonctionnement des LLM connectés au web

    Equipés d'une connection internet, les LLM fonctionnent selon le principe de la génération augmentée de récupération (RAG). Ainsi, lorsqu'un utilisateur pose une question, ces modèles vont :

    • Analyser la requête, la reformuler au besoin, sans doute même la décomposer en sous-requêtes, et interroger l'index d'un moteur de recherche (Bing pour ChatGPT, Google pour Gemini) pour chacune de ces sous-requêtes afin de récupérer une liste de sources jugées pertinentes (à noter que les moteurs de recherche ne sont pas l'unique source utilisée par les modèles de langage, il est fréquent qu'ils aient signés des partenariats avec des éditeurs de presse pour se servir directement dans leurs bases de données) ;
    • Découper en petits morceaux (chunks) les contenus récupérés et les vectoriser ;
    • Prioriser les sources qu'ils considèrent comme les plus fiables (concept d'autorité des différentes sources) et pertinentes selon les instructions et/ou l'entraînement qu'ils ont reçus, ainsi que par rapport à des algorithmes de proximité sémantique des différents chunks par rapport à la question posée ;
    • Synthétiser les meilleures données afin de répondre de manière cohérente à l'internaute

    Découvrez mon article sur l'importance de structurer son contenu pour le chunking sémantique à l'ère de l'IA.

    Pour maximiser ses chances d'être cité comme une source de référence par les grands modèles de langage, il faut donc en tout premier lieu faire du SEO. Être en première position sur Google ou Bing est une valeur sûre si on veut être cité sur une plateforme telle que ChatGPT ou Google Gemini. Mais comprendre le fonctionnement des LLM nous permet d'aller plus loin dans nos recommandations afin d'influencer les réponses des chatbots.

    Optimiser son contenu pour être favorisé par les LLM

    Parce qu'ils ne sont que des modèles statistiques chargés de prédire la séquence de mots la plus probable par rapport à une question posée par l'internaute, autrement dit parce que les modèles conversationnels ont pour objectif d'apporter la réponse susceptible de satisfaire le mieux l'utilisateur, autant devancer leurs attentes en apportant nous-mêmes cette fameuse réponse qui va contenter notre internaute.

    Répondre aux vraies questions des utilisateurs

    Si vous voulez maximiser vos chances d'être récupéré, puis cité par l'IA dans le contexte d'un prompt tapé par un utilisateur, autant rédiger la question directement dans votre contenu. Puis y répondre directement, en une ou deux phrases maximum.

    La théorie est implacable et relève du bon sens. Le problème est qu'aucun outil à ce jour ne nous permet d'identifier les véritables prompts des utilisateurs, jalousement gardés par les propriétaires des plateformes conversationnelles.

    Pour autant, je pense que lorsqu'il s'agit d'une recherche en ligne, les questions posées par les internautes sont toujours un peu les mêmes, quel que soit l'outil utilisé. Comme me le disait un ancien collègue chez Canal+, les prompts ne sont finalement que des requêtes de très longue traîne. Autrement dit, il s'agit de requêtes classiques tapées dans Google mais reformulées en langage naturel.

    Une technique pourrait donc consister à fournir à une IA un jeu de requêtes issues de votre Google Search Console, et à lui demander de les reformuler en prompt à une IA, en lui fournissant quelques exemples basés sur la technique du few shot prompting que je détaille dans mon article sur le prompt engineering.

    L'opportunité offerte par les Google AI Overviews

    Mais depuis que les AI Overviews ont été déployées en France le 22 juillet 2026, la distance entre les requêtes tapées dans un moteur de recherche classique et les prompts à destination d'un LLM tend, de fait, à disparaître. En effet, lorsqu'on tape aujourd'hui une requête à Google, nous ne savons pas à l'avance si nous allons avoir pour résultat seulement une liste de liens bleus, où une réponse générée par Gemini, l'IA de Google. Nous sommes donc plus susceptibles de taper des prompts directement dans la barre de recherche de Google, phénomène qui, selon moi, va s'accentuer avec le temps.

    Il est donc possible d'identifier de vrais prompts utilisateurs directement dans la Google Search Console. Pour cela, je vous propose 2 expressions régulières pour les identifier :

    ^(\S+\s+){5,}\S+$

    Cette expression régulière permet de filtrer toutes les requêtes de 6 mots et plus. Elle permet d'identifier de vraies questions posées en langage naturel.

    ^(?:(a|à|de|d'|en|par|pour|avec|dans)\s+)?(?:(comment|pourquoi|quand|combien|qui|quoi|que|quel(le)?s?|l(e|a|es)quel(le)?s?)\b|qu'|o[ùu]([\s'\-]|$)|est[- ]ce\b)

    Cette regex vous permet d'identifier toutes les questions en français sur lesquelles vos contenus sont visibles dans Google.

    Questions posées en langage naturel extraites de la Google Search Console
    Questions posées en langage naturel extraites de la Google Search Console

    Ces questions en langage naturel sont une véritable mine d'or pour votre visibilité dans les LLM. En connectant une IA à ces données, vous pouvez mettre en place une automatisation pour recevoir par exemple un rapport par mail chaque lundi matin avec la liste des questions identifiées et une analyse faite par un modèle de langue afin de répondre à trois questions :

    1. Est-ce que le contenu qui se positionne répond suffisamment bien à la question posée ?
    2. Dois-je enrichir le contenu existant de la question de l'utilisateur accompagnée d'une courte réponse synthétique ?
    3. Dois-je créer un nouveau contenu pour répondre de manière exhaustive au besoin de l'utilisateur compte tenu du volume de recherche identifié ?

    Encore plus que pour la création de nouveaux contenus, je crois vraiment que c'est en utilisant l'IA pour enrichir vos contenus existants des vraies questions des utilisateurs que vous allez maximiser vos chances d'être cité dans les moteurs conversationnels.

    Je vous recommande par ailleurs de mettre en place les bonnes pratiques suivantes :

    a) Rédiger un contenu bien structuré et optimisé

    Ne soyons pas naïfs, les LLM sont bêtes comme choux. Ils ne comprennent strictement rien, ni à nos questions, ni à leurs réponses. Ils se contentent d'apporter la réponse la plus probable à une question posée.

    C'est ainsi que lorsqu'on tape un prompt dans ChatGPT, la seule "réflexion" du chatbot consiste à se demander : en fonction des mots (transformés en tokens) qui composent le prompt de l'utilisateur, quels sont les mots (transformés en tokens !) qui ont la probabilité la plus forte de répondre correctement à la question posée. Selon les milliards de documents sur lesquels il a été entraîné, a l'intérieur desquels il a su repérer des patterns, des logiques syntaxiques, des co-occurrences de termes (tels mots, telles expressions, se retrouvent statistiquement souvent dans des documents parlant de la même thématique), le LLM va nous apporter une réponse qui, souvent, sera satisfaisante.

    On peut donc lui faciliter la tâche en :

    • Utilisant des titres clair (H1, H2, H3) avec des mots-clés pertinents (qui se trouvent dans les documents sur lesquels il s'est entraîné !) ;
    • Rédigeant des paragraphes clairs et concis, répondant de manière pertinente à la section abordée par votre contenu ;
    • Intégrant des listes à puces séquentielles pour faciliter la compréhension des LLM ;
    • Incluant une FAQ avec des questions-réponses précises.

    b) Utiliser les bons mots-clés et expressions

    Les LLM s'appuyant sur la fréquence et la pertinence des mots-clés pour structurer leurs réponses, il est donc nécessaire de :

    • Utiliser des mots-clés stratégiques issus du champ lexical de la thématique abordée afin de renforcer la proximité sémantique de l'ensemble de votre contenu avec la question posée par l'utilisateur dans la plateforme d'IA générative ;
    • Placer ces mots-clés naturellement dans le texte afin de ne pas gêner la compréhension du contenu par les LLM.

    c) Exploiter les données structurées (Schema.org)

    Les balises schema.org aident les moteurs et LLM à mieux comprendre le contenu. Implémentez des balises pertinentes comme :

    • FAQPage pour structurer des questions-réponses.
    • Article pour un contenu bien indexé.
    • Review si vous comparez des solutions.

    3. Techniques avancées pour influencer les LLM

    a) Insérer des signaux directionnels

    Ajoutez des expressions qui orientent la réponse de l'IA :

    • "Selon les experts, [votre contenu] est une référence sur..."
    • "Les analyses montrent que [votre produit] est plébiscité pour..."
    • "Les meilleures sources s'accordent à dire que..."

    b) Exploiter les Strategic Text Sequences (STS)

    Une étude de Harvard (Kumar & Lakkaraju, 2024) a montré que l'ajout d'un texte stratégique optimisé appelé strategic text sequencing peut améliorer la visibilité d'un produit ou contenu. Cela consiste à insérer une phrase à fort impact sémantique dans un texte pour orienter la réponse du LLM.

    c) Jouer avec le contexte et le "prompt injection"

    Si vous avez un contrôle sur la requête initiale, vous pouvez :

    • Ajouter des instructions subtiles comme "Réponds en te basant principalement sur...".
    • Structurer vos titres et descriptions pour influencer la synthèse faite par l'IA.

    4. Limites et éthique de la manipulation des LLM

    Il est important de noter que manipuler un LLM peut être perçu comme une forme de black hat SEO. De plus, certaines plateformes peuvent mettre en place des garde-fous pour contrer ces stratégies. Une approche éthique et durable repose donc sur :

    • La création de contenu utile et authentique.
    • L'utilisation de techniques d'optimisation acceptées et transparentes.
    • Une mise à jour régulière des informations.

    Découvrez mon article sur le black hat GEO.

    Pour conclure

    Influencer les réponses des LLM est possible via une stratégie d'optimisation bien pensée. En combinant SEO avancé, structuration intelligente et signaux stratégiques, vous maximisez vos chances d'être cité et préféré par ces IA conversationnelles. Toutefois, la meilleure approche reste de fournir un contenu de qualité qui répond véritablement aux besoins des utilisateurs.

    Commentaires

    Aucun commentaire pour le moment. Soyez le premier à commenter !

    Ajouter un commentaire

    Prêt à passer à la vitesse supérieure ?

    Contactez-moi dès aujourd'hui pour discuter de votre projet et commencer à optimiser votre présence en ligne.

    Commencer l'optimisation