---
title: "ChatGPT, Instinct, Grok Bot : notre test"
description: "Cinq configurations, zéro intervention humaine, douze restaurants proposés. Ce que ce test révèle sur la délégation aux agents IA et sur les données qu'ils utilisent pour décider."
url: https://www.weftd.com/fr/resources/use-cases/meme-mission-trois-ia-chatgpt-instinct-grok-bot
locale: fr
alternates:
  en: https://www.weftd.com/resources/use-cases/same-mission-three-ais-chatgpt-instinct-grok-bot
  fr: https://www.weftd.com/fr/resources/use-cases/meme-mission-trois-ia-chatgpt-instinct-grok-bot
---

# ChatGPT, Instinct, Grok Bot : notre test

Cinq configurations, zéro intervention humaine, douze restaurants proposés. Ce que ce test révèle sur la délégation aux agents IA et sur les données qu'ils utilisent pour décider.

_Charles Cousyn · 2026-09-23 · updated 2026-09-23 · agents, délégation, présence IA, restauration_

Les IA grand public changent de forme. Pendant longtemps, on leur demandait surtout de répondre à une question. Une nouvelle génération propose autre chose : leur confier une mission : chercher, comparer, naviguer sur un site, vérifier une information, puis s'arrêter au bon moment. Nous avons voulu voir ce que cela donne en pratique, avec une tâche qu'un utilisateur pourrait facilement déléguer à une IA.

Les 22 et 23 septembre 2026, nous avons donc donné exactement la même mission à Instinct, à Grok Bot et à ChatGPT : trouver trois restaurants près de la gare de Lyon Part-Dieu pour un déjeuner professionnel, avec une table de trois libre à une date précise.

## La réponse courte

Les cinq configurations ont travaillé sans aucune intervention humaine. Elles ont proposé douze restaurants différents, dont un seul est apparu plus de deux fois. Aucune n'a contacté un établissement. Et sur le seul cas que nous avons vérifié jusqu'au bout, l'IA qui a suivi la méthode la plus rigoureuse est celle qui s'est trompée, parce que les informations publiées par le restaurant et par les plateformes où il est présent se contredisent.

## Résumé

- Cinq configurations testées, zéro intervention humaine, des durées allant de moins d'une minute à trente-huit minutes.
- Douze restaurants proposés pour une seule demande, un seul cité par plus de deux configurations.
- La contradiction décisive ne vient pas des IA mais d'un commerce dont le site officiel, un second site, Google et la plateforme de réservation annoncent quatre choses différentes.

## Ce que nous avons voulu observer

Voici le message envoyé, mot pour mot, identique pour toutes les configurations, dans une conversation neuve quand le produit le permettait.

> Je déjeune avec deux clients à Lyon le jeudi 8 octobre à 12h30. Trouve-moi trois restaurants possibles, à moins de dix minutes à pied de la gare de la Part-Dieu, ouverts ce jeudi midi, où une table de trois est disponible à 12h30 ce jour-là, avec au moins un plat principal végétarien à la carte et une addition d'environ 35 euros par personne maximum. Pour chacun, donne-moi le nom, l'adresse, comment tu as vérifié que la table est disponible le 8 octobre et d'où vient chaque information. Ne réserve pas et ne confirme rien. Arrête-toi avant.

Six contraintes, dont cinq se vérifient en ligne. La sixième est d'une autre nature. La disponibilité d'une table à une date précise n'est généralement pas exposée comme une information statique sur la page d'un restaurant : il faut consulter un système de réservation ou contacter l'établissement. C'est cette contrainte qui fait apparaître les différences entre les agents : elle les oblige à décider comment obtenir une information qu'ils ne peuvent pas simplement lire sur une page.

Après le message initial, nous nous sommes interdit toute autre phrase que trois relances neutres, comptées à chaque fois. Aucune n'a été nécessaire.

## Trois expériences de délégation, pas trois modèles

| IA | Interface testée | Approche observée |
|---|---|---|
| Instinct | WhatsApp | Un agent qui navigue sur le web depuis une machine en ligne, piloté par messagerie |
| Grok Bot | Application macOS | Un agent qui travaille sur son propre ordinateur et adapte son plan en cours de route |
| ChatGPT | Web | Trois niveaux de raisonnement comparés, de la réponse immédiate à douze minutes d'analyse |

La différence ne tient donc pas seulement au modèle utilisé. Elle tient à ce que l'interface autorise l'IA à faire : répondre, chercher, cliquer, vérifier, revenir en arrière ou poursuivre une action.

C'est le point important de ce test. Instinct et Grok Bot ne sont pas deux concurrents de plus à classer face à ChatGPT. Ce sont deux façons différentes de recevoir une mission, l'une dans une conversation de messagerie que vous avez déjà ouverte toute la journée, l'autre dans une application dédiée qui vous rend compte étape par étape. Nous ne comparons pas trois modèles, nous comparons trois expériences de délégation.

ChatGPT a été testé dans trois configurations : formule Go en mode Instant, formule Go en mode Analyser, formule Plus en raisonnement élevé. Le réglage change le résultat autant que le produit.

Au total, cinq configurations ont été testées.

| Configuration | IA | Interface |
|---|---|---|
| 1 | Instinct | WhatsApp |
| 2 | Grok Bot | Application macOS |
| 3 | ChatGPT, mode Instant | Web |
| 4 | ChatGPT, mode Analyser | Web |
| 5 | ChatGPT, raisonnement élevé | Web |

Un produit a été écarté et nous préférons dire pourquoi. **Muse**, l'agent personnel de Meta lancé le 8 septembre ([Meta, 8 septembre 2026](https://about.fb.com/news/2026/09/introducing-muse-personal-ai-agent/)), n'était pas accessible en France à la date du test. Le protocole de ce test a été conçu avec Claude, qui ne figure pas non plus dans le panel.

Précision utile : Grok Bot est le service d'agents lancé par xAI en bêta le 11 août 2026, distinct de l'assistant Grok lui-même ([Brief IA, août 2026](https://www.briefia.fr/article/xai-lance-grok-bot-en-beta-prix-et-usages)). Chaque agent y dispose de sa propre machine en ligne.

## Comment chaque IA a procédé

**Instinct**, neuf minutes, trois restaurants livrés.

- il avance dans le parcours de réservation et sélectionne la date, l'heure et le nombre de couverts
- il s'appuie sur TheFork pour la disponibilité et sur Google Maps pour les distances
- il signale de lui-même que deux des menus consultés datent de 2022 et 2023
- il termine en proposant de réserver

**Grok Bot**, trente-huit minutes, deux restaurants livrés.

- il commente chaque étape de son travail
- il élimine deux de ses trois premières pistes après vérification et repart chercher
- c'est la seule configuration à avoir modifié son plan en cours d'exécution
- il joint trois captures d'écran et publie la liste de ce qu'il a écarté avec le motif de chaque rejet
- il signale explicitement qu'une de ses options dépasse la contrainte de distance

**ChatGPT**, de moins d'une minute à douze minutes, aucun restaurant certifié.

- il refuse de certifier une disponibilité qu'il ne peut pas vérifier, dans les trois configurations
- son comportement change nettement selon le niveau de raisonnement, de trois adresses citées à un tableau avec une source par cellule
- il atteint le widget de réservation mais ne le manipule pas

ChatGPT refuse donc de certifier une disponibilité qu'il ne peut pas vérifier directement. Dans notre protocole, il s'arrête avant de manipuler le système de réservation, là où les deux autres produits y entrent.

Même mission, mais déjà trois conceptions différentes de ce que signifie faire le travail.

## Douze restaurants pour une seule demande

Les cinq configurations ont proposé douze établissements distincts. Un seul, PAMPA, est cité par plus de deux d'entre elles. Les trois configurations de ChatGPT, interrogées le même jour avec la même phrase, ont produit trois listes qui ne partagent que ce restaurant.

Les univers ne se recoupent pas et les sources expliquent en partie pourquoi. Instinct et Grok Bot s'appuient sur TheFork et affichent des notes sur dix. ChatGPT mêle des notes Google, des fiches de groupes hôteliers et des cartes de TheFork. Deux des trois propositions de sa configuration la plus poussée sont des restaurants d'hôtel appartenant à une chaîne. Instinct est le seul à n'avoir sorti que des indépendants.

Nous ne tirons pas de loi générale d'un seul test. Mais la question posée à votre établissement est simple : sur quelles surfaces un agent vous trouve-t-il et qu'y lit-il ?

## Le cas Arepado, quatre surfaces et quatre réponses

Arepado, restaurant vénézuélien du 3e arrondissement, a été proposé par Instinct comme disponible le 8 octobre à 12h30. Grok Bot l'a écarté en expliquant que le site officiel n'ouvre que le soir. Nous avons voulu savoir qui avait raison.

Voici ce que nous avons trouvé le 23 septembre.

| Surface | Ce qu'elle indique |
|---|---|
| Site officiel de l'établissement | 19h à 21h30 tous les jours, aucun service du midi |
| Second site du même établissement | Horaires en contradiction avec le premier |
| Google | Pas réservable le midi |
| TheFork | Créneaux de déjeuner à 11h30, 12h00, 12h30, 13h00 et 13h30 le 8 octobre, réservables pour trois |
| Téléphone | Aucune réponse, plusieurs tentatives |
| E-mail au restaurant | Table de trois confirmée à la date demandée |

Nous avons refait nous-mêmes le parcours sur [la fiche TheFork](https://www.thefork.fr/restaurant/arepado-r310705) : sélection du 8 octobre, de 12h30, de trois couverts, jusqu'à l'écran qui demande une adresse e-mail. Aucune réservation n'a été faite. Le [site officiel](https://arepado-lyon.com/fr) affichait au même moment 19h à 21h30 pour tous les jours de la semaine.

**La table est bien disponible. Instinct avait raison.**

**Et Grok Bot s'est trompé malgré un processus de vérification rigoureux.** Il a croisé deux sources, détecté la contradiction, tranché en faveur du commerce lui-même et écarté un restaurant valide. Croiser ses sources ne suffit pas lorsque la source que l'on considère comme la plus fiable est elle-même erronée.

Un détail mérite d'être dit. Grok Bot était allé jusqu'à l'écran d'envoi d'un e-mail au restaurant avant de s'arrêter, parce que notre consigne le lui imposait. C'est exactement le geste qui a produit la bonne réponse quand nous l'avons fait nous-mêmes. Il avait la capacité, notre protocole l'a arrêté à un clic.

## Ce que nous avons vérifié et ce que nous n'avons pas pu trancher

Nous avons appelé PAMPA le 23 septembre à 12h22 : ouvert le jeudi midi, table de trois disponible le 8 octobre à 12h30. Grok Bot l'annonçait, il avait raison. Les trois configurations de ChatGPT refusaient de le confirmer, alors que l'information existait.

Nous n'avons pas tranché les distances. Instinct annonce dix minutes à pied pour Le Pompeï en s'appuyant sur Google Maps. Grok Bot mesure onze à douze minutes avec un autre calculateur d'itinéraire et l'écarte pour dépassement. Sur PAMPA, l'écart entre deux configurations va de cinquante mètres à près de trois cents. Une contrainte formulée en minutes de marche n'a pas de réponse unique : elle dépend du moteur que l'IA a choisi et du point de départ retenu dans une gare qui fait plusieurs centaines de mètres.

## Les plateformes de réservation, un point de passage clé

C'est le rôle le plus discret de ce test et sans doute le plus structurant.

Les deux IA qui ont agi, Instinct et Grok Bot, sont passées par TheFork pour la seule contrainte qu'elles ne pouvaient pas lire directement sur une page. Aucune des deux n'a contacté l'établissement. La plateforme de réservation a donc servi d'interface entre l'agent et le commerce, pour la seule information qui décidait du résultat.

Le cas Arepado ajoute une nuance inattendue. C'est la plateforme qui disait vrai, contre le site officiel du restaurant. L'intermédiaire était mieux tenu que la source première.

ChatGPT, lui, ne s'est pas limité à un canal : il a aussi pioché dans les fiches Google et dans les référentiels de groupes hôteliers. Les plateformes ne sont donc pas le seul chemin par lequel une IA découvre un établissement. Elles ont été, dans ce test, le seul par lequel une action était possible.

Pour un commerçant, la conséquence est concrète. Une partie de ce qu'une IA décide à son sujet dépend d'une fiche qu'il ne consulte parfois plus depuis des mois, chez un tiers, qui pèse davantage que son propre site au moment de la décision.

## Ce que ce test dit de la délégation

Le raisonnement tient en cinq étapes.

1. Les IA deviennent capables d'agir. Cinq configurations sur cinq ont conduit la mission seules, aucune n'a demandé d'aide, toutes se sont arrêtées avant l'acte quand la consigne le demandait.
2. Pour agir, elles doivent interroger des informations extérieures à elles. Un modèle ne sait pas si une table est libre le 8 octobre, il doit aller le chercher.
3. Ces informations sont souvent contradictoires. Sur le seul établissement que nous avons vérifié, quatre surfaces annoncent quatre choses différentes.
4. L'IA doit donc arbitrer entre des sources qui se contredisent, sans moyen de savoir laquelle fait foi.
5. Une information incorrecte produit alors une décision incorrecte, même au terme d'un raisonnement parfaitement cohérent.

Dans notre test, la limite n'était donc pas seulement la capacité des IA à raisonner ou à agir. Elle était aussi dans les informations auxquelles elles avaient accès.

## Ce que ça change pour une entreprise

Un restaurant indépendant a laissé quatre versions de ses horaires circuler, dont deux sur des sites qui lui appartiennent. Résultat : une IA le recommande, une autre l'élimine, une troisième ne le voit pas. Aucune de ces décisions n'a de rapport avec la qualité de sa cuisine.

Ce n'est pas un problème de référencement au sens classique. Personne ne cherchait ce restaurant par son nom. Un agent a appliqué des critères, interrogé les surfaces disponibles et pris une décision à la place d'un client.

Un point pratique au passage : les liens suivis par ChatGPT portent un paramètre qui identifie sa provenance. Vos statistiques de visite peuvent donc déjà vous dire si des agents passent chez vous.

Pour une entreprise, la question devient moins « est-ce que l'IA me connaît ? » que « quelle version de mon entreprise trouve-t-elle lorsqu'elle doit prendre une décision ? ».

À mesure que ces IA deviennent capables de prendre des décisions pour nous, la présence d'une entreprise dans les systèmes d'IA ne sera plus seulement une question de visibilité. Elle deviendra une question de fiabilité : quelle information l'agent trouve-t-il, quelle source croit-il et quelle décision prend-il à partir de celle-ci ?

## Les limites de ce test

Une mission, une ville, une date. L'échantillon ne permet aucune généralisation au-delà de ce cas.

Nous avions prévu deux exécutions par produit. Aucun des deux agents ne permet une répétition indépendante sur un même compte : Instinct n'a qu'un fil de conversation par construction et Grok Bot conserve son contexte d'une conversation à l'autre, ce qu'il indique lui-même. Les secondes exécutions sont des revérifications, pas des répliques. La stabilité de ces produits n'est donc pas mesurée ici.

Les environnements diffèrent. ChatGPT a été testé sur deux formules, dont aucune ne propose de mode agent autonome comparable à celui des deux autres produits. Un compte d'entreprise donnerait peut-être un autre résultat.

Enfin, deux sessions sur cinq ont été conduites par un agent appliquant un script de relance figé, ce qui rend les relances identiques mais ne reproduit pas exactement le comportement d'un utilisateur.

## FAQ

**Quelles IA ont été testées ?**

Instinct sur WhatsApp, Grok Bot en application macOS et ChatGPT dans trois configurations différentes. Muse, l'agent de Meta, n'était pas accessible en France à la date du test.

**Une IA a-t-elle réservé une table ?**

Non. La consigne interdisait toute réservation et toute confirmation. Deux produits ont proposé de réserver et se sont arrêtés en attendant une réponse qui n'est jamais venue.

**Pourquoi les résultats diffèrent-ils autant d'une IA à l'autre ?**

Parce qu'elles n'interrogent pas les mêmes surfaces. Certaines s'appuient sur une plateforme de réservation, d'autres sur les fiches Google ou sur les référentiels de groupes hôteliers. Un établissement absent d'une de ces surfaces n'existe pas pour l'IA qui l'interroge.

**Faut-il en conclure qu'une IA est meilleure que les autres ?**

Non. Ce test n'établit aucun classement. Il montre des comportements différents face à une information non vérifiable et un cas où la méthode la plus rigoureuse a produit la mauvaise réponse.

**Une IA peut-elle réserver un restaurant à votre place ?**

Techniquement, deux des produits testés en sont capables : ils atteignent le dernier écran avant confirmation, celui qui demande une adresse e-mail. L'un d'eux a proposé spontanément de finir la réservation. Notre protocole leur interdisait d'aller plus loin, donc aucune n'a réservé. La limite observée n'est donc pas la capacité à réserver, c'est la fiabilité de l'information sur laquelle la réservation reposerait.

**Quelle différence entre Grok et Grok Bot ?**

Grok est l'assistant conversationnel de xAI. Grok Bot est un autre produit du même éditeur, lancé en bêta le 11 août 2026 : un service d'agents où chaque agent dispose de sa propre machine en ligne, d'un accès au web et de plugins pour agir dans des applications. C'est Grok Bot que nous avons testé, pas Grok.

**Faut-il être présent sur une plateforme de réservation pour être proposé par une IA ?**

Dans ce test, les deux IA qui sont allées jusqu'au bout de la vérification sont passées par une plateforme de réservation, faute d'autre moyen d'obtenir une disponibilité datée. Elles ont aussi découvert des établissements par d'autres canaux, dont les fiches Google. Un seul test ne permet pas d'en faire une règle, mais l'absence d'une de ces surfaces réduit mécaniquement les chances d'être retenu.

**Comment un commerce peut-il éviter ce type d'erreur ?**

En s'assurant que ses horaires, son adresse et ses disponibilités disent la même chose sur toutes les surfaces où un agent peut les lire, à commencer par celles qu'il contrôle lui-même.

## Sources

- [Alphamatch, revue d'Instinct, 17 septembre 2026](https://www.alphamatch.ai/blog/instinct-ai-personal-assistant-review-2026)
- [Meta Newsroom, lancement de Muse, 8 septembre 2026](https://about.fb.com/news/2026/09/introducing-muse-personal-ai-agent/)
- [TechCrunch, Muse, 8 septembre 2026](https://techcrunch.com/2026/09/08/meta-debuts-its-muse-ai-agent-will-consumers-trust-it/)
- [CNBC, adoption de Muse, 21 septembre 2026](https://www.cnbc.com/2026/09/21/meta-muse-personal-ai-agent-downloads.html)
- [Brief IA, lancement de Grok Bot par xAI, août 2026](https://www.briefia.fr/article/xai-lance-grok-bot-en-beta-prix-et-usages)
- [TheFork, fiche Arepado, consultée le 23 septembre 2026](https://www.thefork.fr/restaurant/arepado-r310705)
- [Site officiel Arepado, consulté le 23 septembre 2026](https://arepado-lyon.com/fr)
