Détection de Similarité
Le système utilise l'intelligence artificielle pour détecter et regrouper automatiquement les plaintes similaires, facilitant l'identification des problèmes récurrents et le traitement groupé.
Vue d'ensemble
┌─────────────────────────────────────────────────────────────────────────┐
│ PIPELINE DE SIMILARITÉ │
├─────────────────────────────────────────────────────────────────────────┤
│ │
│ PLAINTES VECTORISATION CLUSTERING GROUPES │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ Texte │ ──▶ │ TF-IDF │ ──▶ │ Cosine │ ──▶ │ Groupes │ │
│ │ plainte │ │ Cohere │ │ Similarity│ │ similaires│ │
│ └──────────┘ └──────────┘ └──────────┘ └──────────┘ │
│ │
└─────────────────────────────────────────────────────────────────────────┘
Technologies utilisées
Le système combine deux approches de vectorisation :
| Méthode | Description | Avantages |
|---|---|---|
| TF-IDF | Term Frequency-Inverse Document Frequency | Rapide, fonctionne hors-ligne |
| Cohere Embeddings | Embeddings sémantiques via API Cohere | Compréhension contextuelle profonde |
Accès
La détection de similarité est visible dans :
- Liste des plaintes : Icône de groupement sur les plaintes similaires
- Détail plainte : Section "Plaintes similaires" en bas de page
- Rapports : Analyse des clusters de plaintes
Groupes similaires
Affichage dans la liste
Les plaintes regroupées sont affichées avec :
| Élément | Description |
|---|---|
| Icône groupe | Indique l'appartenance à un groupe |
| Nombre similaires | Badge avec le nombre de plaintes liées |
| Score similarité | Pourcentage de similarité (70-100%) |
Plier/Déplier les groupes
Dans la liste des plaintes :
- Cliquez sur l'icône ▶ pour déplier un groupe
- Les plaintes similaires s'affichent en sous-liste
- Cliquez sur ▼ pour replier le groupe
Seuil de similarité
Le système considère deux plaintes comme similaires si leur score dépasse 70%.
| Score | Interprétation |
|---|---|
| 90-100% | Très similaires (possible doublon) |
| 80-89% | Similaires (même problématique) |
| 70-79% | Potentiellement liées |
| < 70% | Non groupées |
Cas d'utilisation
Identifier les problèmes récurrents
- Accédez à la liste des plaintes
- Filtrez par catégorie ou région
- Observez les groupes de similarité
- Identifiez les patterns récurrents
Traitement groupé
Pour les plaintes très similaires :
- Identifiez le groupe
- Traitez la plainte principale
- Appliquez la même résolution aux plaintes liées
- Documentez dans chaque plainte la référence croisée
Détecter les doublons
Les plaintes avec un score > 90% peuvent être des doublons :
- Vérifiez les informations du plaignant
- Comparez les dates de création
- Si doublon confirmé, fusionnez ou fermez l'une des plaintes
Configuration
Activation du clustering
Le clustering est activé par défaut. Pour le configurer :
Variables d'environnement :
| Variable | Description | Défaut |
|---|---|---|
COHERE_API_KEY | Clé API Cohere pour embeddings | - |
SIMILARITY_THRESHOLD | Seuil de similarité (0-1) | 0.7 |
ENABLE_SIMILARITY | Activer/désactiver | true |
Mode dégradé
Si l'API Cohere n'est pas disponible :
- Le système utilise uniquement TF-IDF
- La qualité reste bonne pour les textes similaires
- Moins performant sur les reformulations
Fonctionnement technique
Pipeline de traitement
- Extraction : Le texte de la plainte (objet + description) est extrait
- Nettoyage : Suppression ponctuation, normalisation
- Vectorisation : Transformation en vecteur numérique
- Calcul similarité : Distance cosinus entre vecteurs
- Clustering : Regroupement par seuil
Mise à jour automatique
Le clustering est recalculé :
- À la création d'une nouvelle plainte
- Lors de la modification d'une description
- Via tâche planifiée quotidienne (batch)
Statistiques
Dans les rapports
L'onglet Rapports > Plaintes affiche :
| Indicateur | Description |
|---|---|
| Nombre de clusters | Total de groupes identifiés |
| Taille moyenne | Nombre moyen de plaintes par groupe |
| Top clusters | Les groupes les plus importants |
| Évolution | Tendance des problèmes récurrents |
Analyse par catégorie
Les clusters sont analysables par :
- Catégorie de plainte
- Région géographique
- Période temporelle
- Priorité
Bonnes pratiques
:::tip Recommandations
- Examinez les gros clusters : Ils indiquent un problème systémique
- Vérifiez les doublons : Score > 90% = vérification manuelle
- Documentez les liens : Référencez les plaintes liées dans les commentaires
- Traitez en groupe : Les plaintes similaires méritent souvent une réponse coordonnée :::
Permissions requises
| Action | Permission |
|---|---|
| Voir les groupes similaires | plaintes.view |
| Configurer le clustering | parametres.edit |
Limitations
- Le clustering fonctionne mieux avec des descriptions détaillées
- Les plaintes très courtes peuvent être mal classées
- Les langues mélangées (Portugais/Créole) peuvent affecter la précision