Comprendre la limite de tokens de ChatGPT sans prise de tête

Vous êtes en pleine rédaction d’un e-mail important, et ChatGPT s’arrête net. Il affiche un message d’erreur, ou pire, il « oublie » le début de votre conversation. Vous vous demandez ce qui n’a pas fonctionné. La réponse tient en un mot : les tokens. Pas de panique : voici une explication simple de ce qu’est un token, avec des exemples concrets en français, et des solutions pour éviter d’être bloqué à l’avenir.

En résumé, il faut retenir trois points :

  • Un token est une unité de découpage du texte utilisée par le modèle pour traiter l’information.
  • La fenêtre de contexte est un budget limité qui additionne votre prompt, l’historique de la conversation et la réponse générée.
  • Quand la limite est atteinte, ChatGPT tronque la réponse, oublie le début de la conversation ou affiche un message de quota horaire.

La valise à remplir : une image pour tout comprendre

Imaginez que ChatGPT dispose d’une valise de taille fixe. Chaque mot, chaque signe de ponctuation et chaque espace que vous lui envoyez, ainsi que chaque mot qu’il génère, occupe une partie de cette valise. On appelle cette unité un token. Une fois la valise pleine, le modèle ne peut plus traiter votre demande ni produire une réponse complète. Cette valise porte un nom technique : la fenêtre de contexte.

La taille de cette fenêtre varie selon le modèle utilisé. GPT-3.5 avait une petite valise, GPT-4 et GPT-4o en ont une beaucoup plus grande. Mais quelle que soit sa taille, elle reste limitée. C’est une contrainte technique et économique : plus le modèle traite de tokens, plus il utilise de ressources, et plus cela coûte cher à OpenAI. Comprendre ce mécanisme permet de mieux utiliser l’outil au quotidien, surtout lorsqu’on travaille sur de longs documents.

Exemple concret : découpage d’une phrase française en tokens

Prenons une phrase simple : « Bonjour, comment vas-tu aujourd’hui ? » Le modèle ne lit pas cette phrase comme nous. Il la découpe en petits morceaux :

  • « Bonjour »
  • « , »
  • « comment »
  • « vas »
  • « – »
  • « tu »
  • « aujourd »
  • « ’hui »
  • « ? »

Cette phrase de 6 mots représente environ 9 tokens. Le nombre de tokens n’est donc pas égal au nombre de mots. En français, un mot compte souvent pour plus d’un token : « aujourd’hui » en vaut deux. C’est un point fondamental pour comprendre pourquoi la longueur d’un texte français n’est pas directement comparable à celle d’un texte anglais.

Pourquoi ChatGPT a une limite de tokens ?

Ce n’est pas une simple bizarrerie du système. C’est une nécessité technique. Chaque modèle de langage possède une capacité de traitement fixe, mesurée en tokens. Cette capacité est comparable à une mémoire de travail limitée : le modèle ne peut pas « voir » au-delà de cette fenêtre. Il doit tout garder à l’esprit en même temps : votre demande, le contexte, les échanges précédents et la réponse qu’il est en train de rédiger.

D’un point de vue économique, chaque token traité a un coût. Même si vous utilisez la version gratuite, OpenAI doit payer les serveurs et l’énergie nécessaire au calcul. Limiter le nombre de tokens par requête permet de contrôler ces coûts et de garantir un service stable pour tous les utilisateurs. Ce n’est donc pas une limitation arbitraire, mais une gestion de ressources nécessaire.

La fenêtre de contexte : l’entrée plus la sortie

Attention, piège classique : la fenêtre de contexte n’est pas limitée à votre prompt. Elle additionne tout ce que vous envoyez, c’est-à-dire l’entrée, et tout ce que le modèle génère, c’est-à-dire la sortie. Concrètement, si vous avez une conversation de 10 messages avec ChatGPT et que vous lui demandez ensuite de résumer l’ensemble, le modèle doit prendre en compte : l’historique complet, la nouvelle demande et la réponse à venir. Tout doit tenir dans la même valise.

Plus votre conversation est longue, moins il reste de place pour la réponse. C’est exactement pour cela que ChatGPT « oublie » le début d’une conversation et qu’il s’arrête en plein milieu d’un texte : il a épuisé la fenêtre de contexte disponible. Les données qui dépassent sont simplement ignorées ou tronquées.

Cette limitation a aussi un impact direct sur la facturation via l’API. Les tokens d’entrée sont généralement moins chers que les tokens de sortie, mais les deux sont comptés. Si vous envoyez un long historique à chaque requête, vous payez cet historique à chaque appel. Une même conversation de 10 000 tokens envoyée 100 fois représente 1 million de tokens traités. L’addition monte vite, c’est pourquoi il faut savoir gérer la longueur de ses échanges.

Combien de tokens ChatGPT peut-il traiter ?

La réponse dépend du modèle. Les limites ont évolué rapidement et varient encore selon les versions. Voici un tableau récapitulatif des principaux modèles disponibles :

Modèle Fenêtre de contexte Sortie maximale
GPT-3.5 Turbo 4 096 tokens 4 096 tokens
GPT-4 (ancien) 8 192 tokens 8 192 tokens
GPT-4 Turbo 128 000 tokens 4 096 tokens
GPT-4o 128 000 tokens 4 096 tokens
GPT-4.1 1 000 000 tokens (aperçu) 32 768 tokens

À titre de repère, 128 000 tokens représentent environ 90 000 mots en anglais, mais seulement 60 000 mots en français. Oui, vous lisez bien : le français consomme nettement plus de tokens qu’un texte anglais équivalent, en raison des accents, des espaces insécables et de la morphologie. Cette spécificité a une conséquence directe sur la longueur des réponses que vous pouvez obtenir. Un même budget de tokens produit moins de texte en français qu’en anglais.

Ne vous laissez pas éblouir par les grands nombres. Même avec 128 000 tokens, tout n’est pas disponible pour votre réponse. Le système réserve une partie pour l’entrée, une autre pour la sortie, et vous devez compter l’historique de la conversation. Imaginons que vous demandiez à GPT-4o d’analyser un contrat de 50 000 tokens : il reste environ 70 000 tokens pour la réponse, ce qui est encore énorme. Mais si votre conversation contient déjà 100 000 tokens d’historique, la réponse sera très limitée. Le modèle ne peut pas tout faire tenir.

Version gratuite versus version payante : ce qui change vraiment

Sur l’interface web, la différence ne se situe pas tant sur la taille de la fenêtre de contexte que sur le nombre de messages que vous pouvez envoyer par heure. La version gratuite limite fortement le nombre de requêtes. La version Plus, à environ 20 dollars par mois, offre des quotas beaucoup plus généreux et un accès aux modèles les plus récents.

Vous n’avez pas besoin de connaître votre quota exact en tokens sur l’interface web : un simple compteur de messages s’affiche. Mais cette limite est liée aux tokens. Un message très long consomme plus de votre budget qu’un message court. C’est pour cela que certains utilisateurs voient leur demande refusée avec le message « Vous avez atteint la limite de messages », même après seulement quelques échanges. Pour une utilisation intensive, savoir compter les tokens devient un véritable avantage.

Que se passe-t-il quand on atteint la limite ?

Réponse tronquée ou « oubli » du début : les scénarios classiques

Le scénario le plus fréquent se produit en pleine rédaction. Vous demandez à ChatGPT de rédiger un rapport de 3 000 mots. Il commence très bien, puis s’arrête à la moitié. Il a simplement atteint sa limite de sortie, souvent fixée à 4 096 tokens, soit environ 3 000 mots en anglais et 2 500 mots en français.

Ce n’est pas un bug. C’est une protection technique : sans cette limite, une réponse pourrait monopoliser toute la mémoire du serveur. La solution immédiate consiste à envoyer « continue » ou « poursuis ta réponse ». Le modèle reprend là où il s’est arrêté, en utilisant une nouvelle fenêtre de contexte. Ce n’est pas élégant, mais cela fonctionne.

L’autre scénario survient quand la conversation entière dépasse la fenêtre de contexte. Le système est alors obligé de tronquer : il supprime les échanges les plus anciens pour faire place aux nouveaux. Vous constatez que ChatGPT ne se souvient plus de ce que vous aviez dit au début. Ce n’est pas de l’amnésie volontaire, mais un arbitrage technique. Par exemple, si vous collez un long historique de support client de 100 messages, le modèle ne garde que les derniers échanges, et l’analyse finale est incomplète.

La règle d’or : si vous avez besoin que ChatGPT se souvienne de toute une conversation, résumez-la vous-même avant de la lui envoyer. Ne comptez pas sur sa mémoire automatique.

Limite de tokens, limite de messages, limite de requêtes : ne confondez plus tout

Beaucoup d’utilisateurs s’étonnent : « ChatGPT me dit que j’ai atteint ma limite, alors que je n’ai envoyé que 10 messages. » Cette confusion est compréhensible, car trois notions distinctes se ressemblent. Les comprendre permet d’utiliser l’outil plus sereinement et d’éviter les mauvaises surprises.

Quotas horaires et facturation API

Sur l’interface web grand public, la limite est souvent exprimée en messages par période. Elle n’est pas précisément exprimée en tokens, mais elle est corrélée : des messages très longs épuisent le quota plus vite. En version gratuite, vous disposez généralement d’une quinzaine à une vingtaine de messages toutes les trois heures, selon le modèle. En version Plus, les quotas sont beaucoup plus élevés, mais pas illimités.

Sur l’API, c’est différent. On parle de tokens par minute et de requêtes par minute. Le système vous autorise à envoyer un certain volume de tokens chaque minute, même si cela ne représente que quelques requêtes très longues. Cette distinction est cruciale pour les développeurs qui automatisent des tâches : une seule requête peut consommer tout le budget de tokens de la minute.

Côté facturation, chaque appel API est compté précisément. Les tokens d’entrée et de sortie sont facturés séparément, et les tokens de sortie sont souvent plus chers. Sur GPT-4o, le prix est d’environ 2,50 dollars par million de tokens d’entrée et 10 dollars par million de tokens de sortie. Un long rapport généré coûte donc plus cher que le prompt qui l’a demandé. Pour réduire vos coûts, demandez des réponses plus concises, des listes à puces ou des résumés plutôt que des développements complets. C’est contre-intuitif, mais très efficace.

Comment estimer soi-même le nombre de tokens d’un texte

Vous n’avez pas besoin d’être un expert en intelligence artificielle pour savoir si votre prompt va dépasser la limite. Quelques règles simples et un peu de pratique suffisent.

La règle des 4 caractères et des 0,5 mot en français

En anglais, un token représente environ 4 caractères, soit 0,75 mot. En français, la situation est différente : un token représente environ 0,5 à 0,6 mot, à cause des accents, des espaces et de la morphologie. Concrètement :

  • 1 token ≈ 4 caractères en anglais ;
  • 1 token ≈ 3 à 4 caractères en français ;
  • 1 mot français ≈ 1,5 à 2 tokens.

Pour un calcul rapide, prenez votre texte en français, comptez le nombre de mots, puis multipliez par 2. Cela vous donne une estimation haute de votre nombre de tokens. Pour un texte anglais, multipliez par 1,3. Par exemple, un prompt de 500 mots en français représente environ 1 000 tokens. Si vous ajoutez un historique de 3 000 mots, cela fait 6 000 tokens de plus. Pour une réponse de 1 000 mots en français, comptez encore 2 000 tokens. Total de l’opération : 8 000 tokens. Cette méthode permet de vérifier rapidement si vous restez dans la limite.

Pour plus de précision, utilisez le tokenizer en ligne d’OpenAI. Il suffit de coller votre texte pour voir exactement comment il est découpé en tokens, visuellement. C’est éducatif et très utile pour comprendre la notion. Les développeurs peuvent installer la bibliothèque tiktoken en Python, qui reste la référence technique. Attention : chaque modèle peut avoir son propre système de tokenisation, même si la plupart fonctionnent de manière similaire. La méthode du facteur 2 en français reste fiable pour la plupart des usages.

Comment écrire des réponses plus longues malgré la limite ?

C’est la question que tout le monde se pose. Bonne nouvelle : il existe des méthodes éprouvées pour contourner intelligemment la limite sans perdre en qualité. Elles reposent toutes sur le même principe : ne pas tout demander d’un coup.

Découper, résumer, planifier : trois réflexes efficaces

La méthode la plus simple consiste à découper sa demande. Au lieu de demander un article de 5 000 mots, demandez d’abord un plan détaillé. Puis demandez l’introduction. Puis le premier développement, et ainsi de suite. Quand le modèle s’arrête en fin de section, envoyez « continue » ou « poursuis avec la section suivante ». Cette technique évite les réponses tronquées et permet de guider la génération étape par étape.

Pour les longues conversations, adoptez le réflexe du résumé intermédiaire. De temps en temps, demandez à ChatGPT de résumer ce qui a été dit. Copiez ce résumé et commencez une nouvelle conversation avec ce résumé comme contexte initial. Cela libère de la place dans la fenêtre de contexte et évite les oublis. C’est la méthode que j’utilise avec mes clients entrepreneurs lorsque nous travaillons sur un business plan : je résume après chaque étape clé, puis je relance avec ce résumé.

Enfin, avant de demander un long texte, exigez toujours un plan. Demandez à ChatGPT de vous proposer une structure détaillée avec des titres, des sous-titres et les points clés à développer. Validez ce plan, puis demandez la rédaction section par section. Cette approche évite de gaspiller des tokens dans une réponse hors sujet et vous permet de mieux contrôler la longueur du texte généré.

  • Estimez votre consommation avant d’envoyer un prompt long.
  • Découpez les demandes longues en plusieurs étapes.
  • Résumez l’historique pour garder une fenêtre de contexte disponible.