Méthode et ressources
Évaluer une IA en darja tunisienne : protocole et grille à télécharger
Une démonstration agréable ne suffit pas à choisir une IA pour votre équipe. Ce protocole vous aide à tester les faits, les négations, les chiffres et le mélange tunisien-français. La grille peut servir avec Baarcha ou un autre service ; elle ne contient aucun classement ni résultat de performance.
Télécharger la grille et définir votre tâche
Choisissez une seule tâche pour commencer : rédiger une réponse à partir d’une fiche, transcrire une note vocale ou lire un message. Écrivez ce qui doit être exact et qui relira le résultat. Une erreur de montant peut être plus grave qu’une différence de ponctuation.
Le fichier CSV contient des cas de départ fictifs et des colonnes de résultats laissées vides. Vous pouvez le modifier et le partager, y compris pour comparer d’autres outils. Aucune adresse email n’est demandée. Citez cette page si elle vous est utile ; ce n’est pas une condition pour utiliser la grille.
Construire un petit jeu d’essai représentatif
Préparez au moins dix exemples par tâche pour un premier diagnostic. Ce nombre est un point de départ pratique, pas une validation statistique. Ajoutez ensuite des exemples variés issus de votre usage, avec l’autorisation nécessaire et sans données personnelles inutiles.
Gardez un groupe d’exemples de côté. Si vous modifiez les instructions après avoir vu une erreur, testez la nouvelle version sur ce groupe pour éviter de mesurer seulement votre adaptation aux exemples connus.
| Cas | Entrée à préparer | À vérifier |
|---|---|---|
| Négation | Le client ne veut pas annuler, seulement déplacer un rendez-vous | Aucune annulation inventée |
| Information absente | Une demande de tarif sans grille de prix | Le système demande le prix ou signale son absence |
| Changement de langue | Une phrase en tunisien contenant confirmation ou livraison | Même intention avant et après le passage en français |
| Chiffres | Une heure et un montant, avec leur référence humaine | Heure, valeur et unité conservées |
| Audio difficile | Un second enregistrement avec un bruit réaliste | Erreurs comparées séparément au cas calme |
Tester le chat sur le sens
Fournissez les mêmes faits et la même consigne aux outils comparés. Notez si chaque réponse conserve les informations, respecte les refus et évite d’inventer une action. Évaluez le style séparément de l’exactitude. Ne présentez pas une préférence personnelle comme une mesure de performance.
La consigne suivante ne suppose pas que le système puisse modifier un rendez-vous : elle demande de reformuler une demande. Le résultat attendu est une demande de déplacement à vendredi à dix heures, sans annulation et sans confirmation automatique.
Un exemple à adapter
الحريف قال: ما نحبّش نفسخ الموعد، نحب كان نبدّلو للجمعة مع العشرة متاع الصباح. لخّص الطلب بالتونسي. ما تقولش اللي الموعد تبدّل خاطر ما عندكش تأكيد.
Tester la transcription et la voix séparément
Pour la transcription, faites écrire une référence humaine avant le test. Gardez le même fichier pour tous les outils. Comptez les erreurs de noms, de nombres et de négations, puis le temps nécessaire pour obtenir un texte utilisable. Si vous publiez un taux d’erreur de mots, documentez aussi vos règles d’écriture de la darja, de normalisation et de découpage des mots.
Pour la synthèse vocale, utilisez le même texte. Faites écouter les sorties sans annoncer le système quand c’est possible. Demandez aux auditeurs de noter les mots manquants, la compréhension et la prononciation. Une voix plaisante n’est pas nécessairement fidèle au texte.
Une boucle synthèse puis transcription peut aider au diagnostic, mais ne remplace pas l’écoute humaine : les deux systèmes peuvent partager une erreur. Une phrase générée artificiellement ne remplace pas non plus un enregistrement réel pour évaluer la reconnaissance vocale.
Partager des résultats que d’autres peuvent vérifier
Publiez la date, le nom et la version du modèle quand elle est connue, les paramètres, les consignes et la taille du jeu d’essai. Séparez le temps de réponse du temps de correction humaine. Précisez le matériel ou les conditions réseau si vous comparez la latence.
Montrez aussi les échecs et les limites du jeu de test. Ne partagez les enregistrements et les sorties que si vous en avez le droit. Un résultat sur votre tâche n’établit pas qu’un modèle est meilleur pour tous les usages.
Baarcha propose cette méthode pour rendre les essais plus transparents. Cette page et sa grille ne revendiquent aucune supériorité de Hannibal, Fennec ou Dido sur un autre système.