Reddit abandonne la barrière du karma
Reddit veut que ses communautés dépendent moins du karma et de l’ancienneté du compte, et davantage d’une détection qui lit le message. L’e-mail a fait le même virage, et il a un coût.
Le 5 août 2026, Reddit a publié une note sur la modernisation de son infrastructure et de ses outils de modération. La presse a surtout retenu que Old Reddit exige désormais une connexion. Pour qui construit des filtres, la phrase importante est ailleurs : l’objectif de Reddit est que ses communautés « puissent moins dépendre de choses comme le karma et l’ancienneté du compte … et davantage d’une prévention des abus intégrée aux systèmes qu’elles utilisent ».
Une barrière de karma ne lit jamais le message
Les seuils de karma et d’ancienneté posent une question sur l’auteur, jamais sur ce qu’il a écrit. Ils fonctionnent parce que le spam est une affaire de volume : un compte neuf ne coûte rien, et exiger de chaque compte quelques semaines et quelques votes avant de pouvoir publier rend cher ce qui était gratuit.
La facture est payée par le nouveau venu honnête, indiscernable d’un spammeur pour un test qui ne regarde que l’ancienneté. Reddit nomme ce coût directement : les nouveaux utilisateurs « rencontrent des barrières invisibles comme l’ancienneté du compte et les seuils de karma, des suppressions inexpliquées et une mauvaise découverte des communautés ».
L’e-mail applique le même système depuis vingt ans sous d’autres noms. Listes noires d’IP, âge du domaine, greylisting, scores de réputation d’expéditeur, listes blanches des gens à qui vous avez déjà écrit. Chacun est une barrière de karma. Un serveur de messagerie fraîchement installé qui envoie son premier message légitime ressemble exactement à un nœud de spam, et c’est la première raison pour laquelle le courrier auto-hébergé finit en indésirables.
Un message, quatre façons de le juger
Un compte publie pour la première fois. Que vérifiez-vous ?
Les quatre tournent en production quelque part aujourd’hui. Ils ne coûtent pas la même chose et n’échouent pas dans le même sens.
Que regarde réellement votre filtre ?
Le moins cher, et il ne lit jamais le message.
Arrête les comptes jetables, et arrête avec eux tous les vrais nouveaux venus. C’est la barrière sur laquelle Reddit veut que ses communautés s’appuient moins.
Automod est une regex. Rules Hub est un modèle.
Reddit est inhabituellement explicite sur le mécanisme. Les outils d’Automod « dépendent d’une correspondance exacte de mots-clés et de motifs », tandis que Rules Hub « utilise des LLM pour évaluer si un message correspond à l’intention d’une règle ». L’outil est testé par plus de 700 communautés et s’ouvre dès maintenant à toute communauté nouvellement créée.
Le filtrage du spam a fait ce virage en premier, dans le même ordre : règles écrites à la main, puis comptage statistique de mots, puis des modèles qui lisent le message comme de la langue et non comme un sac de jetons. Chaque étape a échangé une règle lisible par un humain contre une précision mesurable par un humain. La première partie de notre série sur les modèles détaille ce que fait vraiment cette étape de lecture.
Ce que Reddit peut se permettre et vous non
Reddit annonce plus de 130 millions de visiteurs par jour, plus de 100 000 communautés, et des millions de messages et commentaires quotidiens. Un appel de modèle de langage par élément à ce volume n’est pas une ligne de budget, c’est le budget. Reddit peut l’absorber. Un forum Discourse, un wiki, un espace de commentaires ou un serveur de messagerie, non.
Le classifieur que nous faisons tourner est l’autre étage. C’est un encodeur : 12 couches, environ 270 millions de paramètres, 219 Mo une fois quantifié, qui note un message en quelques dizaines de millisecondes sur le GPU d’un portable, sans aucun serveur. Il ne peut pas vous dire si un message est hors sujet dans une communauté donnée, et il ne le pourra jamais : cette question demande le texte de la règle et un modèle capable de raisonner dessus. Il peut vous dire, pour une fraction de centime d’électricité, si c’est du spam.
C’est la forme de la réponse pour tous ceux qui ne sont pas Reddit : le modèle léger lit tout, et le modèle cher ne lit que la tranche que le léger n’a pas su séparer.
Nous n’avons pas supprimé la réputation. Nous l’avons rétrogradée.
Abandonner la réputation serait la mauvaise leçon. Klar lit toujours les signaux d’expéditeur : les verdicts DKIM et DMARC portés par le message, le fait qu’il réponde ou non dans un fil que vous avez ouvert, et une table de réputation de marques. Aucun n’est une barrière. Chacun est replié sur le score que le modèle de contenu a déjà produit, et le pré-filtre statistique est câblé pour ne pouvoir que pousser un verdict vers le spam, jamais l’en sortir. Le moteur est open source si vous voulez vérifier cet ordre vous-même.
Rien de tout cela n’est propre à l’e-mail. Le modèle lit du texte court, donc le même moteur note des conversations à plusieurs tours : c’est ce qui tourne dans Klar for Messages sur iPhone, et ce qui tourne comme milter sur votre propre serveur.
Reddit construira son propre étage léger, sur des étiquettes issues d’une décennie d’actions de modération que personne d’autre ne possède. C’est très bien. L’intérêt de cette annonce n’est pas que quelqu’un ait besoin de notre moteur. C’est que la plus grande plateforme communautaire d’internet vient de dire publiquement que les barrières de réputation sont le mauvais réglage par défaut et que lire le contenu est le bon. C’est le pari sur lequel ce produit est construit, et il est agréable de le voir tenu à 130 millions de personnes par jour.
Consulter les sources originales
Toutes les citations ci-dessus viennent de l’une d’elles. La première est la source primaire.
- Modernizing Reddit’s Infrastructure and Moderation Tools Reddit Inc. · 5 août 2026
- Reddit aims to make karma less important for first-time posters TechCrunch · 5 août 2026
- Reddit expands test of moderation tools Social Media Today · août 2026
- klar-im/engine Le classifieur et la couche de décision décrits ci-dessus, AGPL-3.0