Mis à jour : 9 mai 2026 · Réévalué chaque trimestre
Méthodologie : comment nous choisissons l'IA derrière les réponses StarReview
Nous avons testé 13 modèles d'IA de pointe sur 53 vrais avis Google suisses dans 6 langues. Voici ce qui s'est passé, quels modèles ont atteint notre seuil et lesquels ne l'ont pas atteint.
Résultats clés
- 9 modèles sur 13 testés ont franchi notre seuil de conformité par règles (0 phrase interdite, 0 tiret cadratin sur 53 avis).
- mistral-large disqualifié, tirets cadratins dans 42% (22/53) des réponses.
- gpt-5 (Chat Completions) a ajouté des détails opérationnels absents de l'avis, une vraie responsabilité pour un outil de réponse public.
- Nous pondérons la sécurité + l'ancrage avant la vitesse brute, le choix de production est basé sur le profil complet de sécurité, qualité et temps de réponse.
Ce qui fait une bonne réponse
On affirme beaucoup de choses sur les avis et la visibilité locale. Ce qui tient : dans sa propre documentation Business Profile, Google cite le nombre d'avis et les notes en étoiles parmi les éléments qui peuvent soutenir le classement local. Un élément parmi d'autres, aux côtés de la pertinence et de la distance, pas un levier à lui seul. Les réponses elles-mêmes ne sont pas un facteur de classement confirmé, et dans des enquêtes comme le Local Consumer Review Survey annuel de BrightLocal et les Local Search Ranking Factors de Whitespark, leur poids mesuré a plutôt reculé au fil des années.
L'intérêt d'une réponse est ailleurs, et il est plus concret : vos réponses sont lues par des personnes qui ont déjà trouvé votre profil et qui hésitent encore. Pour que cela porte, la réponse doit être spécifique, nommer le client et son problème concret, pas un langage standardisé.
C'est précisément là que la plupart des réponses IA échouent. C'est le sujet des sections suivantes.
Pourquoi la plupart des réponses IA aux avis Google sont mauvaises
La plupart des outils de réponse aux avis utilisent un LLM par défaut sans montrer comment ils l'ont choisi. Le résultat : des phrases corporate génériques. « Merci pour vos mots, votre satisfaction est notre priorité. » Ce genre de réponse nuit à la marque plus qu'il ne l'aide.
Une bonne réponse à un avis Google demande trois choses : l'ancrage dans ce que le client a réellement écrit (pas de détails inventés), une voix humaine naturelle dans la langue et le registre corrects, et la sécurité sur les avis juridiquement sensibles (pas d'aveu de responsabilité, pas de fuite de données). Quels modèles offrent cela n'apparaît pas dans les fiches techniques. Il faut tester.
Notre cadre de test
- 53 avis réels issus de profils PME suisses, anonymisés
- 6 langues : français (12), anglais (25), allemand (3), italien (11), portugais (1), chinois (1)
- 13 modèles de pointe, tous les modèles actuels d'OpenAI, Anthropic, Google, Mistral
- Évaluation par règles : 37 motifs de phrases interdites par langue, détection de tirets cadratins, nombre de mots, latence
- Examen manuel de sécurité sur les avis négatifs DE/FR, parce que les tests par règles ne mesurent pas l'ancrage ni le ton
Réserve sur l'échantillon : la base est restaurant-lourde et ne contient que 3 avis en allemand. La prochaine évaluation trimestrielle rééquilibrera vers une majorité d'avis suisses-allemands.
Les résultats dépendent du prompt, du mode d'API, de la date du test et du jeu d'évaluation. La conformité aux règles seule ne prouve pas l'aptitude à la production, c'est un seuil minimum.
Les 13 modèles testés
Triés par temps de réponse. Moins de phrases interdites et zéro tiret cadratin sont préférables. Le temps de réponse est indiqué par palier et non comme une mesure, voir « Ce que nous ne divulguons pas ».
| Modèle | Temps de réponse | Mots (médiane) | Interdits | Tirets cadratins | Statut |
|---|---|---|---|---|---|
| gpt-4.1-mini | rapide | 37 | 0 | 0 | propre |
| gpt-4.1 | rapide | 32 | 0 | 0 | propre |
| claude-haiku-4-5 | rapide | 37 | 0 | 1 | tiret cadratin en DE |
| mistral-large | rapide | 42 | 0 | 22 | tirets cadratins (42%) |
| gpt-5-codex | moyen | 40 | 0 | 0 | propre |
| gpt-5.2-codex | moyen | 36 | 0 | 0 | propre |
| claude-sonnet-4-6 | moyen | 43 | 0 | 0 | propre |
| claude-opus-4-7 | moyen | 41 | 0 | 0 | propre |
| gemini-2.5-flash | moyen | 51 | 1 | 0 | phrase interdite en DE |
| o4-mini | lent | 36 | 0 | 0 | propre |
| gemini-3-pro-preview | lent | 40 | 0 | 0 | propre |
| gpt-5 | lent | 44 | 0 | 0 | détails inventés (voir ci-dessous) |
| gemini-2.5-pro | lent | 37 | 0 | 0 | propre |
Ce que les données montrent : modes d'échec à signaler
mistral-large : tirets cadratins en spam
22 réponses sur 53 (42%) contenaient des tirets cadratins ou demi-cadratins. C'est un signal IA classique qui détruit immédiatement l'effet « ressemble à un vrai humain ». Disqualifié.
gemini-2.5-flash : phrase interdite en DE
Gemini Flash a produit l'une de nos phrases-clichés interdites (« nous savons à quel point c'est important... ») dans une des trois réponses en allemand. Avec seulement 3 tests DE, 1 incident est un pourcentage élevé.
claude-haiku-4-5 : tiret cadratin en DE
Une réponse en allemand contenait un tiret cadratin. Marginal, mais suffisant pour faire sortir Haiku du peloton de tête en conformité.
Un modèle de raisonnement : détails opérationnels inventés
Dans notre exécution, cela concernait gpt-5 via Chat Completions. Le modèle a produit des réponses conformes aux règles, mais a ajouté des détails qui n'étaient pas dans l'avis. Sur un avis FR 2★ concernant un brunch : « Nous avons revu la formule à 32 CHF : pain artisanal, jambon de meilleure coupe, omelette plus généreuse... » Aucun de ces éléments n'était dans l'avis. Pour un outil de réponse public, c'est un vrai risque : le propriétaire ne peut pas prétendre publiquement avoir fait des choses qu'il n'a jamais faites. Ce n'est pas un jugement général sur le modèle, c'est un résultat pour ce prompt, cette configuration API et cette tâche.
Seul un petit nombre de modèles a atteint notre seuil
Sur 13 modèles testés, 9 ont franchi la barre de la conformité par règles (0 phrase interdite, 0 tiret cadratin). Après l'examen manuel de sécurité, qui teste l'ancrage, le ton et la véracité, l'ensemble s'est encore réduit.
Nous ne divulguons pas publiquement quel modèle nous utilisons en production. Cela fait partie de notre position concurrentielle. Ce qui est public, c'est notre méthodologie, nos critères et nos résultats. Les chiffres ne sont toutefois pas exactement reproductibles : la génération n'est volontairement pas déterministe, et le modèle évaluateur varie lui aussi légèrement. Deux exécutions identiques ne donnent pas exactement les mêmes valeurs. Les petits écarts entre modèles relèvent donc du bruit, pas d'un classement.
Nos critères de sélection
Nous évaluons les modèles selon ces critères, dans cet ordre :
- Sécurité : pas d'invention, pas d'aveu de responsabilité, pas de fuite de données sur d'autres clients ou employés
- Ancrage dans l'avis : les réponses reprennent ce que le client a réellement écrit. Pas de phrases génériques, pas de détails inventés.
- Multilinguisme suisse : qualité constante en DE-CH, FR-CH, IT-CH, avec les registres corrects (Sie / vous / lei) et les idiomes suisses
- Adéquation du ton par secteur : chaleureux pour les restaurants, désamorçant sur les avis négatifs, professionnel-empathique en santé
- Temps de réponse : assez rapide pour que le tableau de bord paraisse immédiat quand le propriétaire clique sur « générer une réponse »
- Coût : viable au volume PME (centaines à milliers d'avis par mois)
Nous n'optimisons pas la vitesse pure. Les modèles les plus rapides de notre test se sont révélés systématiquement génériques et superficiels sur l'ancrage. Nous échangeons de la vitesse contre de la qualité.
Ce que nous ne divulguons pas, et pourquoi
Nous ne nommons pas le modèle que nous utilisons en production. Nous réévaluons chaque trimestre, et la réponse à « quel est le meilleur modèle ? » change quand de nouveaux modèles arrivent. Nous voulons pouvoir changer sans réécrire nos affirmations marketing. Le véritable avantage est dans le processus d'évaluation continu : critères, cas de test, examen manuel et la volonté de changer de modèle. La méthodologie et les critères sont publics ; l'implémentation est la nôtre.
Pour la même raison, nous indiquons le temps de réponse par palier et non au dixième de seconde. Des valeurs de latence exactes, combinées à nos critères de sélection, permettraient de réduire le champ à un seul modèle, ce qui rendrait la non-divulgation purement décorative. Les chiffres de conformité du tableau, phrases interdites, tirets cadratins et nombre de mots, restent inchangés et exacts. C'est là l'étude proprement dite.
Ce que vous obtenez avec StarReview
Dans notre exécution d'évaluation de mai 2026, la configuration de modèle derrière StarReview a satisfait notre seuil : 0/53 phrases interdites, 0 tiret cadratin et 0 détail opérationnel inventé, avec des temps de réponse qui ne font jamais attendre dans le tableau de bord, dans les 6 langues testées. Concrètement :
- Des réponses qui ressemblent à un vrai patron, 37 filtres par langue bloquent les clichés IA avant publication
- Ancrées dans l'avis réel, 0/53 détails inventés à l'examen manuel de sécurité ; un modèle non choisi a ajouté des détails opérationnels
- Ton multilingue suisse en DE-CH, FR-CH, IT-CH et anglais, testé sur 53 vrais avis
- Filtres de phrases interdites avec 37 motifs par langue, construits à partir de clichés IA identifiés dans de vrais avis suisses
- Réévaluation trimestrielle, prochaine exécution août 2026 ; nous changeons si un nouveau modèle dépasse notre seuil
Comment nous réglons par secteur
Les réponses aux avis comportent des risques propres au secteur. Pour un cabinet médical, il s'agit du secret professionnel suisse (art. 321 CP) et de ce que la réponse peut dire de la relation patient. Pour un garage, il s'agit de promesses de réparation sans accord écrit. Pour un restaurant, d'assurances générales d'hygiène sans mesure concrète.
StarReview est réglé différemment selon le secteur :
- Prompts système spécifiques au secteur, avec des règles de prudence intégrées
- Filtres de phrases spécifiques au secteur, qui dirigent les formulations à risque vers la validation humaine ou les font régénérer avant publication
- Dans le secteur de la santé, chaque réponse exige une validation humaine, indépendamment de la note en étoiles
- Tests de fumée à chaque mise à jour du modèle, contre les modes d'échec typiques par secteur
Nous ne publions pas les motifs et prompts exacts. Cela fait partie de notre stack concurrentielle. La méthodologie et les critères sont publics ; la mise en œuvre concrète est la nôtre.