Méthodologie · Benchfolk Index
Comment on mesure la visibilité des grandes maisons
dans les réponses des IA.
Un journaliste, un producteur ou un concurrent doit pouvoir refaire nos tests à la maison. Cette page décrit exactement ce qu'on interroge, chez qui, comment on compte les citations, et surtout ce que notre méthode ne capture pas. Version 1.1, juillet 2026 — mise à jour à chaque évolution du protocole.
Ce qu'on mesure
La visibilité IA — pas la qualité du vin
Le Benchfolk Index mesure une seule chose : quand un amateur pose à ChatGPT, Claude, Perplexity ou Gemini une question typique sur son univers de consommation premium, quelles marques sortent dans la réponse ?
C'est une mesure de share of voice dans les réponses des grands modèles de langage — l'équivalent, pour les IA génératives, du rang organique dans Google.
Ce n'est pas une évaluation qualitative des cuvées, ni un baromètre d'appréciation critique. Un Champagne peut être une œuvre absolue de vinification et être totalement absent des recommandations IA ; l'inverse est aussi vrai. Les IA répondent à partir de leurs sources d'entraînement et du web indexé — pas d'une dégustation en aveugle.
Les 4 IA testées
ChatGPT, Claude, Perplexity, Gemini — pondérées par usage réel
Nous interrogeons les quatre grands assistants IA généralistes utilisés par le public francophone, avec la recherche web activée quand elle est disponible :
- ChatGPT — modèle
gpt-4o, recherche web activée par défaut. Poids : 55 %. - Gemini — modèle
gemini-2.5-flash(Google), avecgoogle_searchgrounding activé. Poids : 25 %. - Perplexity — modèle
sonar, recherche web native (l'outil est bâti dessus). Poids : 10 %. - Claude — modèle
claude-haiku-4.5(Anthropic), avec l'outil de recherche web activé. Poids : 10 %.
Pourquoi pondérer ? Un utilisateur français ne pose pas ses questions à « une IA moyenne » : ~55 % des requêtes IA généralistes en France passent par ChatGPT, ~25 % par Gemini (couplage Google + intégration Android), le reste se répartit entre Perplexity, Claude et quelques niches. Une mesure équi-pondérée sur-représenterait les IA de niche. Le Score IA reflète ce que les Français entendent vraiment, pas ce que 4 modèles disent à parts égales.
Google AI Overviews n'est pas testé (pas d'API publique stable). Les modèles ci-dessus sont ceux effectivement en production ; nous versionnons chaque changement de modèle et chaque révision des poids d'usage dans l'historique de l'Index. Source des poids : estimation basée sur Similarweb et l'observation du marché IA généraliste FR (juillet 2026), révisable tous les 3 mois.
Évolution mensuelle
Chaque marque suivie mois après mois
Chaque édition mensuelle est comparée à la précédente. Le classement expose deux deltas par marque :
- Δ rang — mouvement dans le classement (↑ montée, ↓ descente, = stable). Une marque nouvellement dans le classement affiche « New ».
- Δ Score IA — variation du score /100. Filtre le bruit statistique LLM : une variation de ± 2 points est du bruit ; ± 5 est un signal ; ± 10 est un mouvement structurel qui vaut d'être expliqué.
Cette colonne apparaît à partir de l'édition d'août 2026 — juillet 2026 étant la 1re édition mensuelle publiée, il n'y a pas encore de mois précédent à comparer.
Les prompts
15 questions par catégorie — publiques, en français, sourcées
Pour chaque catégorie (champagne, cognac, whisky, Bordeaux, avec extension progressive à Rhône, avec extension progressive à la Bourgogne), nous testons 15 prompts curés qui reproduisent les intentions réelles d'un amateur français : recommandation générale, budget, occasion (mariage, cadeau, gastronomie), style (blanc de blancs, single malt, rive droite), comparaison entre grandes maisons, découverte de vignerons artisans.
Les prompts ont été rédigés dans le vocabulaire de la catégorie, pas dans une formulation technique de marketing. Un exemple champagne :
« Compare-moi Krug, Dom Pérignon et Salon — lequel choisir pour quel usage ? »
Les 120 prompts (15 × 8 panels) sont publics et téléchargeables directement au format JSON :
- /index-prompts/champagne.json — 15 prompts Maisons de champagne (NM)
- /index-prompts/champagne-rm.json — 15 prompts Vignerons (RM)
- /index-prompts/champagne-cm.json — 15 prompts Coopératives (CM)
- /index-prompts/cognac.json — 15 prompts cognac
- /index-prompts/whisky.json — 15 prompts whisky
- /index-prompts/bordeaux.json — 15 prompts Bordeaux
- /index-prompts/rhone.json — 15 prompts Rhône
- /index-prompts/bourgogne.json — 15 prompts Bourgogne
Licence CC BY 4.0 — libre de réutilisation avec attribution. Pour les réponses brutes agrégées de la dernière édition, écrivez à presse@benchfolk.com.
Nous excluons les questions qui demandent de recommander un distributeur (« quelle cave en ligne… ? ») : elles évaluent le caviste, pas la marque. En revanche, nous incluons la prescription professionnelle (« que devrait référencer un caviste ? »), car elle mesure bien la capacité d'une marque à entrer dans une sélection.
Univers des marques suivies
Un panel curé, borné, honnête
Notre univers de suivi comporte entre 15 et 40 marques par panel, soit une fraction volontairement restreinte du marché réel. La sélection s'appuie sur :
- Champagne — trois panels séparés pour ne pas comparer des modèles économiques différents : 30 maisons (NM), 29 vignerons récoltants-manipulants (RM) et 15 coopératives de manipulation (CM).
- Cognac — 40 marques réparties en trois strates complémentaires : 12 marques mondiales, 13 maisons indépendantes et 15 producteurs-récoltants ou artisans. Le classement reste commun : les strates servent à construire un univers représentatif, pas à fabriquer trois palmarès artificiels.
- Whisky — 40 marques : 20 écossaises et 5 références pour chacun des marchés japonais, irlandais, américain et français. Les origines structurent le panel, mais restent réunies car les acheteurs arbitrent réellement entre elles.
- Bordeaux — 40 propriétés : 15 icônes de la rive gauche, 12 références de la rive droite, 5 propriétés de Sauternes ou Barsac et 8 valeurs de découverte.
- Rhône — 40 entités canoniques distinctes couvrant Rhône Nord et Rhône Sud. Domaine Jean-Louis Chave et J.-L. Chave Sélection sont notamment suivis séparément.
- Bourgogne — 40 domaines et maisons : 14 en Côte de Nuits, 14 en Côte de Beaune, 4 à Chablis, 4 en Côte Chalonnaise ou Mâconnais et 4 grandes maisons.
Cet univers n'est pas exhaustif. Si les IA citent une marque hors panel (par exemple Fleury en biodynamie champenoise), nous l'observons dans les réponses brutes mais elle n'entre pas dans le classement du panel officiel. Nous élargissons le panel chaque trimestre selon les mentions récurrentes observées et les demandes presse.
Comment on compte les citations
Le Score IA — ce qui compte, c'est d'être nommé en tête
Pour chaque combinaison (prompt × IA × marque), nous vérifions par pattern matching précis (nom canonique + alias déclarés, avec bornes de mot pour éviter les faux positifs du type « champagne Drappier » qui matchait sur le mot « champagne » seul) si la marque apparaît dans la réponse générée — et, quand elle apparaît, à quel rang par rapport aux autres marques citées dans la même réponse.
Nous exposons deux chiffres complémentaires :
- Citations (« Cité X/15 ») — nombre de prompts distincts où la marque apparaît dans la réponse d'au moins une des quatre IA testées. Maximum : 15. C'est la fréquence — êtes-vous mentionnée ou pas ?
- Score IA (0 à 100) — pondération par rang d'apparition dans chaque réponse LLM. Une marque nommée en 1er vaut 10 points, en 2e 7 points, 3e 5 points, 4-5e 3 points, 6e et au-delà 1 point. Le total est normalisé sur le maximum théorique (tous les prompts × toutes les IA × 10 pts). C'est ce qui compte vraiment — êtes-vous nommée en tête de la recommandation de l'IA, ou perdue au milieu d'un paragraphe ?
Le classement principal utilise le Score IA. Une marque citée 7 fois en 1re position peut devancer une marque citée 11 fois en 6e position : ce qu'on mesure, c'est la saillance dans l'esprit de l'IA, pas juste la fréquence de mention.
Le « cercle de tête » (core club) est le plus petit sous-ensemble de marques qui capte 50 % ou plus du Score IA total de la catégorie — un indicateur de concentration : plus le cercle est petit, plus le marché IA est verrouillé sur une poignée de noms.
Exemple concret (champagne, édition juillet 2026) : Dom Pérignon obtient le Score IA le plus haut (27/100) parce que les IA le nomment en tête de leurs recommandations, même s'il n'est cité que sur 7 questions sur 15. Laurent-Perrier est cité plus souvent (11/15) mais plus loin dans les listes, ce qui donne un Score IA de 25/100.
Fréquence et reproductibilité
Publication le premier lundi de chaque mois, 06h00 Europe/Paris
L'Index est régénéré une fois par mois, le premier lundi à 06 h 00 Europe/Paris. Chaque édition est conservée avec un identifiant technique, mais la vue publique l'affiche comme un mois éditorial — par exemple « Juillet 2026 ». L'historique complet est disponible sur demande.
Pourquoi mensuel plutôt qu'hebdomadaire ? Parce que les IA génératives ont un rythme d'évolution mensuel (mises à jour de modèles, indexation web) et que le rythme éditorial de la presse vin est mensuel/bimestriel. Une lecture mensuelle lisse le bruit statistique naturel des LLMs (non-déterminisme) et donne un « Baromètre du mois » plus lisible qu'un « chiffre de la semaine ».
Les IA génératives ne sont pas déterministes : deux exécutions du même prompt peuvent produire des réponses différentes. C'est un fait, pas un défaut. Nous en tenons compte de deux manières :
- Nous conservons le texte intégral de chaque réponse en base (table
index_runs). Un mouvement mois-vs-mois dans le classement s'explique en remontant à la donnée brute. - Nous publions un « gate qualité » : si plus de 20 % des appels IA d'une édition échouent (rate limit, timeout, refus modéré), l'édition n'est pas publiée — les données brutes sont conservées pour diagnostic.
Ce que l'index ne capture pas
Les honnêtetés méthodologiques
- La qualité intrinsèque du vin ou du spiritueux. Une absence de l'index n'est pas un jugement de qualité, c'est un déficit de présence dans les sources entraînant les IA (Wikipedia, presse indexée, Knowledge Graph, sites structurés).
- Les marques hors panel. Si les IA citent régulièrement une maison que nous ne suivons pas encore, elle n'apparaît pas dans le classement — mais elle est observée dans nos réponses brutes et prise en compte à l'itération suivante du panel.
- La géolocalisation des utilisateurs. Nous interrogeons les IA en français depuis nos serveurs, sans contexte utilisateur. Les IA peuvent personnaliser leurs réponses selon l'historique, la région IP, la version d'app — nos chiffres représentent la « ligne de base » sans personnalisation.
- Le lien de causalité citation IA → vente. Nous mesurons la visibilité ; nous ne prétendons pas mesurer directement l'impact commercial. La corrélation avec les ventes réelles reste un travail à faire en croisant nos données avec les GfK, IWSR ou Nielsen des maisons partenaires.
- La performance sur les langues autres que le français. L'Index actuel est FR-only. Extension EN prévue Q4 2026 (marché primaire du whisky, du Bordeaux international et du champagne export).
Contact presse
Reproduire, contester, approfondir
Nous fournissons sur demande le fichier complet des prompts, les réponses brutes de la dernière édition, l'historique mois par mois et l'accès aux critères de sélection des marques :
Télécharger le dossier PDF ↓presse@benchfolk.com
Contestation méthodologique bienvenue : si vous pensez que notre panel omet une maison essentielle, que nos prompts sont biaisés, ou que notre métrique passe à côté d'un phénomène important, écrivez-nous. Chaque évolution du protocole est datée et documentée publiquement.