Preuves — lisez l'étiquette d'abord
Le benchmark que nous avons exécuté nous-mêmes, publié avec ses limites.
Méthode
Une seule variable sépare les trois bras
Un corpus généré de 10 000 documents à vérité terrain connue, dont environ 1 sur 10 est un scan. Un ensemble de 148 questions couvrant les cinq choses que l'on demande à un ensemble de documents. Trois bras — Citenda, le même modèle IA sur les mêmes fichiers dans un dossier, et le même modèle sans aucun corpus — avec le même matériel, les mêmes budgets et le même correcteur. 444 runs au total ; chacun a retourné une réponse. La seule chose qui diffère entre les bras est ce que nous vendons.
Résultats
Ce que Citenda a répondu — et ce que le même modèle a répondu sans lui
- Sur le corpus généré de 10 000 documents, Citenda a répondu à 93,2 % des 148 questions au budget de 10 minutes — le même modèle IA, avec les mêmes fichiers dans un dossier, a répondu à 56,8 %.
- Sans aucun corpus, le même modèle a répondu à 17,1 % de l'ensemble des 148 questions de ce run — le témoin qui montre que les questions ne sont pas répondables à partir de connaissances générales.
- Dans un budget de 60 secondes sur le même corpus généré, Citenda a été correct et a terminé sur 81,1 % des questions ; le bras dossier-brut a terminé à 11,5 %. Temps médian de réponse sur l'ensemble des 444 runs : 28 secondes.
- Sur le comptage et la totalisation à travers tout le corpus généré, l'avance de Citenda sur le bras dossier-brut était de +68 points ; sur la confirmation qu'un élément est absent, +76 points.
- 99,3 % des réponses de Citenda sur ce run résolvent vers un identifiant de citation stable que vous pouvez rouvrir des mois plus tard.
Règles de lecture
Ces chiffres voyagent sous conditions
- Le corpus est nommé dans la phrase, à chaque fois. À une échelle différente, ou sur un corpus aux propriétés différentes, ces chiffres seraient différents — un chiffre qui omet son corpus est faux dans un sens ou dans l'autre.
- Le tripwire n'est pas amovible. Il figure au-dessus de la ligne de flottaison ici et voyage avec chaque citation de ce run, partout.
- Citenda est le sujet ; les bras sont le contraste. Nous publions ce que Citenda a répondu à côté de ce que le même modèle a répondu sans lui. Nous ne benchmarkons ni ne passons en revue le produit de qui que ce soit d'autre.
- Le témoin est cité dans sa forme généreuse. Le bras sans corpus réussit certaines questions en refusant de répondre ; nous citons le chiffre toutes-questions plutôt que la variante plus sévère qui exclut ces réussites-par-refus.
- Aucun chiffre de cette page n'entre dans un devis ou un contrat. Un chiffre de benchmark n'est pas un engagement sur votre archive.
Limites
Les limites font partie du résultat
- Corpus synthétique. Nous l'avons généré ; c'est ce qui rend la vérité terrain vérifiable, et ce qui empêche ces chiffres d'être des chiffres clients.
- Un domaine, un ensemble de questions, un correcteur.
- Nous l'avons exécuté nous-mêmes. Aucun tiers ne l'a reproduit. Nous publions ce fait plutôt que de l'adoucir.
- Aucun chiffre ici n'est une affirmation sur votre archive. L'exactitude sur un corpus client réel n'est pas mesurée tant qu'une mission réelle ne la mesure pas — ce qui est exactement ce que l'Estate Assessment existe pour démarrer.
Publier ces limites est le but, pas une concession : un chiffre que vous pouvez vérifier, avec l'étiquette qui le qualifie, c'est le produit qui fait sa propre publicité.