Aller au contenu principal

Détection de Similarité

Le système utilise l'intelligence artificielle pour détecter et regrouper automatiquement les plaintes similaires, facilitant l'identification des problèmes récurrents et le traitement groupé.

Vue d'ensemble

┌─────────────────────────────────────────────────────────────────────────┐
│ PIPELINE DE SIMILARITÉ │
├─────────────────────────────────────────────────────────────────────────┤
│ │
│ PLAINTES VECTORISATION CLUSTERING GROUPES │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ Texte │ ──▶ │ TF-IDF │ ──▶ │ Cosine │ ──▶ │ Groupes │ │
│ │ plainte │ │ Cohere │ │ Similarity│ │ similaires│ │
│ └──────────┘ └──────────┘ └──────────┘ └──────────┘ │
│ │
└─────────────────────────────────────────────────────────────────────────┘

Technologies utilisées

Le système combine deux approches de vectorisation :

MéthodeDescriptionAvantages
TF-IDFTerm Frequency-Inverse Document FrequencyRapide, fonctionne hors-ligne
Cohere EmbeddingsEmbeddings sémantiques via API CohereCompréhension contextuelle profonde

Accès

La détection de similarité est visible dans :

  1. Liste des plaintes : Icône de groupement sur les plaintes similaires
  2. Détail plainte : Section "Plaintes similaires" en bas de page
  3. Rapports : Analyse des clusters de plaintes

Groupes similaires

Affichage dans la liste

Les plaintes regroupées sont affichées avec :

ÉlémentDescription
Icône groupeIndique l'appartenance à un groupe
Nombre similairesBadge avec le nombre de plaintes liées
Score similaritéPourcentage de similarité (70-100%)

Plier/Déplier les groupes

Dans la liste des plaintes :

  1. Cliquez sur l'icône pour déplier un groupe
  2. Les plaintes similaires s'affichent en sous-liste
  3. Cliquez sur pour replier le groupe

Seuil de similarité

Le système considère deux plaintes comme similaires si leur score dépasse 70%.

ScoreInterprétation
90-100%Très similaires (possible doublon)
80-89%Similaires (même problématique)
70-79%Potentiellement liées
< 70%Non groupées

Cas d'utilisation

Identifier les problèmes récurrents

  1. Accédez à la liste des plaintes
  2. Filtrez par catégorie ou région
  3. Observez les groupes de similarité
  4. Identifiez les patterns récurrents

Traitement groupé

Pour les plaintes très similaires :

  1. Identifiez le groupe
  2. Traitez la plainte principale
  3. Appliquez la même résolution aux plaintes liées
  4. Documentez dans chaque plainte la référence croisée

Détecter les doublons

Les plaintes avec un score > 90% peuvent être des doublons :

  1. Vérifiez les informations du plaignant
  2. Comparez les dates de création
  3. Si doublon confirmé, fusionnez ou fermez l'une des plaintes

Configuration

Activation du clustering

Le clustering est activé par défaut. Pour le configurer :

Variables d'environnement :

VariableDescriptionDéfaut
COHERE_API_KEYClé API Cohere pour embeddings-
SIMILARITY_THRESHOLDSeuil de similarité (0-1)0.7
ENABLE_SIMILARITYActiver/désactivertrue

Mode dégradé

Si l'API Cohere n'est pas disponible :

  • Le système utilise uniquement TF-IDF
  • La qualité reste bonne pour les textes similaires
  • Moins performant sur les reformulations

Fonctionnement technique

Pipeline de traitement

  1. Extraction : Le texte de la plainte (objet + description) est extrait
  2. Nettoyage : Suppression ponctuation, normalisation
  3. Vectorisation : Transformation en vecteur numérique
  4. Calcul similarité : Distance cosinus entre vecteurs
  5. Clustering : Regroupement par seuil

Mise à jour automatique

Le clustering est recalculé :

  • À la création d'une nouvelle plainte
  • Lors de la modification d'une description
  • Via tâche planifiée quotidienne (batch)

Statistiques

Dans les rapports

L'onglet Rapports > Plaintes affiche :

IndicateurDescription
Nombre de clustersTotal de groupes identifiés
Taille moyenneNombre moyen de plaintes par groupe
Top clustersLes groupes les plus importants
ÉvolutionTendance des problèmes récurrents

Analyse par catégorie

Les clusters sont analysables par :

  • Catégorie de plainte
  • Région géographique
  • Période temporelle
  • Priorité

Bonnes pratiques

:::tip Recommandations

  1. Examinez les gros clusters : Ils indiquent un problème systémique
  2. Vérifiez les doublons : Score > 90% = vérification manuelle
  3. Documentez les liens : Référencez les plaintes liées dans les commentaires
  4. Traitez en groupe : Les plaintes similaires méritent souvent une réponse coordonnée :::

Permissions requises

ActionPermission
Voir les groupes similairesplaintes.view
Configurer le clusteringparametres.edit

Limitations

  • Le clustering fonctionne mieux avec des descriptions détaillées
  • Les plaintes très courtes peuvent être mal classées
  • Les langues mélangées (Portugais/Créole) peuvent affecter la précision

Voir aussi