Preuves — lisez l'étiquette d'abord

Le benchmark que nous avons exécuté nous-mêmes, publié avec ses limites.

Méthode

Une seule variable sépare les trois bras

Un corpus généré de 10 000 documents à vérité terrain connue, dont environ 1 sur 10 est un scan. Un ensemble de 148 questions couvrant les cinq choses que l'on demande à un ensemble de documents. Trois bras — Citenda, le même modèle IA sur les mêmes fichiers dans un dossier, et le même modèle sans aucun corpus — avec le même matériel, les mêmes budgets et le même correcteur. 444 runs au total ; chacun a retourné une réponse. La seule chose qui diffère entre les bras est ce que nous vendons.

Résultats

Ce que Citenda a répondu — et ce que le même modèle a répondu sans lui

Part des questions correctement répondues, par budget de temps Sur le corpus généré de 10 000 documents, la part des 148 questions correctement répondues et terminées augmente avec le budget de temps. Citenda atteint 81,1 % dans un budget de 60 secondes et 93,2 % à 10 minutes. Le même modèle sur les fichiers bruts dans un dossier atteint 11,5 % à 60 secondes et 56,8 % à 10 minutes. Le témoin sans corpus reste stable à 17,1 %. L'axe du temps est logarithmique. 100 % 75 % 50 % 25 % 0 % 10s30s60s2min5min10min Budget de 60 secondes 81,1 % 11,5 % Moteur Citenda 93,2 % à 10 min Dossier brut 56,8 % à 10 min Sans corpus 17,1 % — stable
Part de l'ensemble des 148 questions correctement répondues et terminées dans chaque budget de temps, sur le corpus généré de 10 000 documents. L'axe du temps est logarithmique. Run synthétique — nous avons généré le corpus ; ce n'est pas une affirmation d'exactitude client.

Règles de lecture

Ces chiffres voyagent sous conditions

Limites

Les limites font partie du résultat

Publier ces limites est le but, pas une concession : un chiffre que vous pouvez vérifier, avec l'étiquette qui le qualifie, c'est le produit qui fait sa propre publicité.