Aller au contenu
Tous les guides

Méthode et ressources

Évaluer une IA en darja tunisienne : protocole et grille à télécharger

Une démonstration agréable ne suffit pas à choisir une IA pour votre équipe. Ce protocole vous aide à tester les faits, les négations, les chiffres et le mélange tunisien-français. La grille peut servir avec Baarcha ou un autre service ; elle ne contient aucun classement ni résultat de performance.

Télécharger la grille et définir votre tâche

Choisissez une seule tâche pour commencer : rédiger une réponse à partir d’une fiche, transcrire une note vocale ou lire un message. Écrivez ce qui doit être exact et qui relira le résultat. Une erreur de montant peut être plus grave qu’une différence de ponctuation.

Le fichier CSV contient des cas de départ fictifs et des colonnes de résultats laissées vides. Vous pouvez le modifier et le partager, y compris pour comparer d’autres outils. Aucune adresse email n’est demandée. Citez cette page si elle vous est utile ; ce n’est pas une condition pour utiliser la grille.

Construire un petit jeu d’essai représentatif

Préparez au moins dix exemples par tâche pour un premier diagnostic. Ce nombre est un point de départ pratique, pas une validation statistique. Ajoutez ensuite des exemples variés issus de votre usage, avec l’autorisation nécessaire et sans données personnelles inutiles.

Gardez un groupe d’exemples de côté. Si vous modifiez les instructions après avoir vu une erreur, testez la nouvelle version sur ce groupe pour éviter de mesurer seulement votre adaptation aux exemples connus.

CasEntrée à préparerÀ vérifier
NégationLe client ne veut pas annuler, seulement déplacer un rendez-vousAucune annulation inventée
Information absenteUne demande de tarif sans grille de prixLe système demande le prix ou signale son absence
Changement de langueUne phrase en tunisien contenant confirmation ou livraisonMême intention avant et après le passage en français
ChiffresUne heure et un montant, avec leur référence humaineHeure, valeur et unité conservées
Audio difficileUn second enregistrement avec un bruit réalisteErreurs comparées séparément au cas calme

Tester le chat sur le sens

Fournissez les mêmes faits et la même consigne aux outils comparés. Notez si chaque réponse conserve les informations, respecte les refus et évite d’inventer une action. Évaluez le style séparément de l’exactitude. Ne présentez pas une préférence personnelle comme une mesure de performance.

La consigne suivante ne suppose pas que le système puisse modifier un rendez-vous : elle demande de reformuler une demande. Le résultat attendu est une demande de déplacement à vendredi à dix heures, sans annulation et sans confirmation automatique.

Un exemple à adapter

الحريف قال: ما نحبّش نفسخ الموعد، نحب كان نبدّلو للجمعة مع العشرة متاع الصباح. لخّص الطلب بالتونسي. ما تقولش اللي الموعد تبدّل خاطر ما عندكش تأكيد.

Tester la transcription et la voix séparément

Pour la transcription, faites écrire une référence humaine avant le test. Gardez le même fichier pour tous les outils. Comptez les erreurs de noms, de nombres et de négations, puis le temps nécessaire pour obtenir un texte utilisable. Si vous publiez un taux d’erreur de mots, documentez aussi vos règles d’écriture de la darja, de normalisation et de découpage des mots.

Pour la synthèse vocale, utilisez le même texte. Faites écouter les sorties sans annoncer le système quand c’est possible. Demandez aux auditeurs de noter les mots manquants, la compréhension et la prononciation. Une voix plaisante n’est pas nécessairement fidèle au texte.

Une boucle synthèse puis transcription peut aider au diagnostic, mais ne remplace pas l’écoute humaine : les deux systèmes peuvent partager une erreur. Une phrase générée artificiellement ne remplace pas non plus un enregistrement réel pour évaluer la reconnaissance vocale.

Partager des résultats que d’autres peuvent vérifier

Publiez la date, le nom et la version du modèle quand elle est connue, les paramètres, les consignes et la taille du jeu d’essai. Séparez le temps de réponse du temps de correction humaine. Précisez le matériel ou les conditions réseau si vous comparez la latence.

Montrez aussi les échecs et les limites du jeu de test. Ne partagez les enregistrements et les sorties que si vous en avez le droit. Un résultat sur votre tâche n’établit pas qu’un modèle est meilleur pour tous les usages.

Baarcha propose cette méthode pour rendre les essais plus transparents. Cette page et sa grille ne revendiquent aucune supériorité de Hannibal, Fennec ou Dido sur un autre système.