Courbe de lift et courbe de gains cumulés
La courbe de gains cumulés et la courbe de lift sont deux lectures d'une même population, classée par un modèle du score le plus élevé au plus faible. La première donne, pour chaque part de la population contactée en partant du haut du classement, la part des réponses captées; la diagonale du tirage au hasard lui sert de référence. Le lift rapporte ce que capte une part du classement à ce que capterait la même part tirée au hasard. Il se calcule de deux manières, cumulée ou tranche par tranche, et seule la seconde dit où s'arrêter. Le business analyst s'en sert pour trancher une question de budget: jusqu'où descendre dans la liste classée. La réponse se lit sur la courbe de profit, qui ajoute au classement le coût d'un contact et la valeur d'une réponse, et le livrable est ce seuil, assorti des hypothèses qui le fondent.
Objectif
Les deux courbes se construisent sur l'ordre qu'induit un score par unité, probabilité prédite ou note quelconque, et elles répondent à une seule question: combien de réponses capte-t-on en ne contactant que les mieux classés. La décision qu'elles servent est budgétaire: une campagne de relance ou une opération de rétention dispose d'une enveloppe bornée et doit choisir qui elle traite.
Le livrable est le seuil, exprimé en déciles ou en pourcentage de la population classée, avec les hypothèses qui le fondent: le coût d'un contact, la valeur d'une réponse, le jeu de validation dont les chiffres proviennent et le taux de base, la part de répondants dans la population entière. Le tableau de gains appartient au livrable au même titre que le graphique: un seuil sans son tableau ne se vérifie pas.
La matrice de confusion, que traite la fiche data mining, mesure un modèle à un seuil de décision déjà fixé: elle compte les vrais et les faux positifs. Les deux courbes sont l'instrument par lequel ce seuil se choisit.
Usage
Quand l'utiliser
- Score ou classement disponible: le modèle rend une propension par unité, calibrée ou non, dont seul l'ordre compte.
- Budget ou capacité plafonnés: le nombre de cas traités est borné et il faut choisir lesquels, qu'il s'agisse d'un ciblage de campagne, d'une opération de rétention ou d'une file de recouvrement, de contrôle de fraude ou de revue de dossiers.
- Coût de contact et valeur de réponse chiffrables: la courbe de profit devient calculable et le seuil s'en déduit.
- Comparaison de deux modèles candidats: sur une même population, la courbe qui domine capte plus de réponses à budget égal.
- Arbitrage à présenter à un comité: la courbe se lit sans connaître le modèle et se discute en CHF.
Quand ne pas l'utiliser
- Sortie binaire sans score sous-jacent: un moteur de règles ne fournit aucun classement, prendre la matrice de confusion au seuil de décision que la règle impose déjà.
- Cible continue: une prévision de volume ou de montant ne se convertit pas en réponses captées, recourir à une mesure d'erreur de prévision.
Description
Le classement, matière première des deux courbes
Un modèle de classification supervisé rend une propension, la probabilité de réponse qu'il prédit. La transformer en décision binaire exige un seuil de décision, et Provost et Fawcett observent que beaucoup de décisions d'affaires se passent de cette étape: il leur suffit d'ordonner la population et d'agir du haut vers le bas jusqu'à épuisement du budget (Data Science for Business). Couper la liste classée à un rang revient à fixer ce seuil de décision indirectement; le seuil dont traite cette fiche est ce rang, exprimé en part de la population. La calibration du score est donc indifférente: un score qui surestime toutes les probabilités trace les mêmes courbes qu'un score juste, tant qu'il ordonne la population de la même façon.
La courbe de gains cumulés
La population triée par score décroissant est découpée en tranches de taille égale: dix déciles selon la convention du marketing direct, des centiles sur les grandes populations, où le tracé se lisse. L'abscisse porte la part cumulée de la population contactée en partant du haut du classement, de 10% en 10% jusqu'à 100%. L'ordonnée porte la part cumulée des réponses réelles captées dans cette tranche de tête. Un point se lit ainsi: à 30% de la population contactée, l'ordonnée donne la part des répondants atteinte. Jaffery et Liu (2009) documentent cette lecture et le découpage en déciles dont elle vient.
La diagonale y = x est la référence: contacter X% de la population au hasard capte en moyenne X% des réponses. Elle est le modèle nul, et Fawcett en fait le socle commun des évaluations par classement, analyse ROC comprise (2006). La courbe d'un modèle utile est concave et se tient au-dessus; elle s'écarte le plus de la diagonale dans les premiers déciles et rejoint le point (100%, 100%): en contactant tout le monde on capte tout le monde, quel que soit le modèle.
Le lift, sous deux constructions distinctes
Le lift mesure de combien une tranche fait mieux que le hasard. Il se calcule de deux manières que la pratique confond régulièrement, et chacune sert une décision différente.
Le lift cumulé est le rapport entre la courbe de gains cumulés et la diagonale: part cumulée des réponses divisée par part cumulée de la population. Tracé contre cette même part, il part haut et décroît, parce que chaque tranche ajoutée est moins dense en réponses que la précédente. Au dernier point il vaut exactement 1,00, puisque numérateur et dénominateur y valent tous deux 100%.
Le lift par décile se calcule tranche par tranche, sans cumul: taux de réponse de la tranche divisé par le taux de base. Il se trace en barres contre le numéro de décile. C'est la mesure marginale, indépendante des tranches qui la précèdent.
La distinction commande le choix du seuil. Le lift cumulé converge vers 1,00 par construction, si bien qu'il reste au-dessus de 1 longtemps après le point où prolonger la campagne coûte plus qu'elle ne rapporte. Un lecteur qui n'a que cette courbe y voit un modèle encore meilleur que le hasard et en conclut qu'il faut continuer. La variable de décision est le lift par décile ou, mieux, le profit marginal de la tranche.
Lift cumulé
Lift du décile
Construire le tableau, décile par décile
- Scorer chaque unité de la population avec le modèle, puis trier par score décroissant.
- Découper la liste triée en tranches de taille égale, dix par convention.
- Compter dans chaque tranche les réponses réelles, relevées sur un jeu de validation étiqueté.
- Calculer le taux de réponse de la tranche: ses réponses divisées par son effectif.
- Diviser ce taux par le taux de base pour obtenir le lift du décile.
- Cumuler les réponses des tranches 1 à k, puis rapporter ce cumul au total des réponses pour obtenir le gain cumulé.
- Diviser le gain cumulé par la part cumulée de la population pour obtenir le lift cumulé.
- Multiplier les réponses de la tranche par la valeur d'une réponse, en soustraire son effectif multiplié par le coût d'un contact: c'est le profit marginal, dont le cumul donne la courbe de profit.
Les huit calculs donnent les huit colonnes du tableau de gains. Tracer la courbe de gains cumulés avec sa diagonale, puis la courbe de lift en indiquant laquelle des deux constructions est tracée: une légende qui dit seulement « lift » laisse le lecteur deviner laquelle.
Le seuil: point d'équilibre et courbe de profit
Deux chiffres ferment le calcul: le coût d'un contact et la valeur d'une réponse. Ils viennent de la comptabilité analytique et du métier, les mêmes chiffres qu'une analyse coûts-bénéfices consomme, et le coût divisé par la valeur donne le point d'équilibre. Une tranche dont le taux de réponse propre dépasse ce point ajoute du profit; une tranche en dessous en détruit, y compris quand le cumul reste favorable. Rapporté au taux de base, le point d'équilibre se lit aussi en lift: 6,25% sur une population qui répond à 9,3% vaut un lift de 0,67, la hauteur de la ligne d'équilibre sur un graphique de lift par décile.
La courbe de profit cumule le profit marginal tranche par tranche, et son maximum désigne le seuil. Tant que le taux de réponse décroît de tranche en tranche, ce qu'un classement qui fonctionne produit, s'arrêter au sommet revient à s'arrêter à la dernière tranche dont le taux propre franchit le point d'équilibre: un cumul cesse de croître exactement quand le terme ajouté devient négatif. Le raisonnement vient du choix de seuil sous coûts asymétriques et distributions incertaines posé par Provost et Fawcett (Machine Learning, 2001); la courbe de profit en est la forme lisible par une audience d'affaires (Data Science for Business). Sans coût de contact ni valeur de réponse chiffrables il n'y a pas de seuil à optimiser, et le classement s'utilise tel quel.
Ce qui fausse la lecture
Un lift mesuré sur les données d'entraînement est optimiste. Le surapprentissage y flatte le premier décile, et la première question à poser devant un graphique porte sur le jeu dont il vient.
Un taux de base faible rend les déciles bruyants. Un lift de 4,0 calculé sur douze réponses ne se distingue pas d'un lift de 2,5, par pure variance d'échantillonnage. Le garde-fou est une analyse exploratoire des effectifs bruts par tranche, avant de lire le moindre pourcentage.
Deux populations de taux de base différents donnent des lifts incomparables. Le même modèle affiche un lift plus élevé sur une population où l'événement est rare, si bien que comparer deux campagnes demande de confronter chaque courbe de gains cumulés à sa propre diagonale ou de normaliser.
Le tableau se remplit avec des réponses observées. Multiplier une probabilité prédite par l'effectif de la tranche et traiter le résultat comme un nombre de réponses produit un profit imaginaire, dont le seuil hérite.
La capacité opérationnelle prime sur l'arithmétique. Le seuil optimal et le seuil réalisable ne tombent pas au même endroit, et les rapprocher, en étalant la campagne ou en révisant le périmètre, est un travail de business analyst.
Le seuil se recalcule à chaque campagne. Il dépend du coût de contact et de la valeur de réponse, qui dérivent, ainsi que du taux de base, qui bouge d'une opération à l'autre. Reprendre tel quel le seuil de l'exercice précédent revient à décider sur des hypothèses périmées, sans que rien dans le graphique ne le signale.
Considérations IA
Le gain le plus net est la production du tableau. Les huit colonnes sont un travail de code répétitif dont la spécification tient en une page, et un modèle de langage en écrit un premier jet en SQL ou en Python que l'analyste relit contre les définitions. Le second usage est la traduction: expliquer à un comité pourquoi la campagne s'arrête au cinquième décile, en partant du tableau et des deux hypothèses, est le travail de reformulation qu'un modèle de langage fait bien.
Les plateformes d'apprentissage automatique produisent ces graphiques par défaut, ce qui déplace le travail vers deux questions de recette: sur quel jeu le graphique a été calculé et laquelle des deux constructions de lift est tracée.
Un modèle de langage à qui l'on soumet la seule courbe de gains cumulés en tire un seuil confiant, lu sur le coude de la courbe, argument de forme là où la décision est économique: ni le coût d'un contact ni la valeur d'une réponse ne figurent dans le graphique. Savoir si le jeu de validation ressemble à la population qui sera contactée reste un jugement sur l'organisation et ses données.
Exemples
Une caisse maladie suisse prépare une campagne de rétention sur son portefeuille d'assurances complémentaires, à l'approche des échéances de résiliation. Un modèle score 20'000 assurés selon leur propension à accepter un entretien de rétention et la population est découpée en dix déciles de 2'000. Un contact revient à CHF 25, appel du conseiller et traitement compris. Un assuré retenu vaut CHF 400, soit le coût d'acquisition qu'il évite plus la marge nette d'une année de prime. Le taux de base relevé sur le jeu de validation est de 9,3%, 1'860 répondants.
| Décile | Réponses | Taux de réponse | Lift du décile | Gains cumulés | Lift cumulé | Profit marginal | Profit cumulé |
|---|---|---|---|---|---|---|---|
| 1 | 600 | 30,0% | 3,23 | 32,3% | 3,23 | +190'000 | 190'000 |
| 2 | 400 | 20,0% | 2,15 | 53,8% | 2,69 | +110'000 | 300'000 |
| 3 | 280 | 14,0% | 1,51 | 68,8% | 2,29 | +62'000 | 362'000 |
| 4 | 200 | 10,0% | 1,08 | 79,6% | 1,99 | +30'000 | 392'000 |
| 5 | 140 | 7,0% | 0,75 | 87,1% | 1,74 | +6'000 | 398'000 |
| 6 | 100 | 5,0% | 0,54 | 92,5% | 1,54 | -10'000 | 388'000 |
| 7 | 70 | 3,5% | 0,38 | 96,2% | 1,37 | -22'000 | 366'000 |
| 8 | 40 | 2,0% | 0,22 | 98,4% | 1,23 | -34'000 | 332'000 |
| 9 | 20 | 1,0% | 0,11 | 99,5% | 1,11 | -42'000 | 290'000 |
| 10 | 10 | 0,5% | 0,05 | 100% | 1,00 | -46'000 | 244'000 |
- taux de réponse du décile au-dessus du point d'équilibre de 6,25%
- taux de réponse du décile en dessous
Le point d'équilibre vaut 25 ÷ 400, soit 6,25%. Le décile 5 le franchit avec 7,0%, le décile 6 échoue avec 5,0% et le profit cumulé culmine à CHF 398'000 puis décroît de tranche en tranche. Le lift cumulé vaut encore 1,54 au sixième décile et ne tombe à 1,00 qu'au dixième: à aucun moment il ne signale où s'arrêter. Le seuil retenu est donc de cinq déciles, 10'000 assurés sur 20'000.
CHF 25 par contact, CHF 400 par assuré retenu
La cellule de rétention place 800 appels par semaine et il reste huit semaines avant l'échéance, soit 6'400 contacts contre les 10'000 que demande le seuil. La capacité tranche avant l'arithmétique: la campagne s'arrête au troisième décile, 6'000 assurés, pour CHF 362'000, soit CHF 36'000 sous l'optimum. Le business analyst chiffre les deux chemins qui ramènent ces 36'000 et laisse le sponsor arbitrer: avancer le lancement de cinq semaines porte la capacité à 10'400 contacts; porter la cadence à 1'250 appels par semaine couvre les 10'000 en huit semaines.
Ce que le business analyst remet tient en une page: le seuil, cinq déciles ou trois sous la contrainte de capacité; le tableau de gains; les hypothèses de CHF 25 et de CHF 400 avec leur provenance; le jeu de validation et le taux de base; la date du prochain recalcul.
Visualisations
La courbe de gains cumulés avec sa diagonale montre ce que le classement rapporte, et le repère posé sur le seuil y attache la décision. Les deux constructions du lift, côte à côte sur les mêmes données, montrent la courbe cumulée au-dessus de 1 quand les barres marginales sont déjà passées sous le point d'équilibre. La courbe de profit exprime le seuil en francs, l'unité dans laquelle un comité décide. Le tableau de gains porte les chiffres que la courbe ne montre pas.
Coût
| Phase | Niveau | Justification |
|---|---|---|
| Préparation | Moyen | Le calcul est trivial une fois les scores disponibles. Le coût est ailleurs: obtenir un jeu de validation étiqueté et faire établir par le métier deux chiffres que personne ne tient prêts. |
| Exécution | Faible | Un tri, un découpage en déciles et huit colonnes de calcul, en SQL ou dans un tableur. L'affaire d'une demi-journée quand les données sont là. |
| Documentation | Faible | Le tableau de gains, les graphiques et une page d'hypothèses. |
Outils
Un tableur suffit dès que les scores sont exportés: dix lignes, huit colonnes et deux graphiques natifs. Le calcul y reste visible devant un comité. Sur de grandes populations, le découpage en tranches se fait en SQL avec la fonction de fenêtrage NTILE. En Python, scikit-learn fournit les scores et matplotlib le tracé; scikit-plot sort les deux courbes en une ligne. En R, les paquets ROCR et lift couvrent le même besoin. SAS Enterprise Miner et IBM SPSS Modeler les tracent sans écrire de code. La courbe de profit se trace presque toujours à la main.
Sources
- Jaffery, T. et Liu, S. X., Measuring Campaign Performance by Using Cumulative Gain and Lift Chart, SAS Global Forum 2009, Paper 196-2009: la construction standard de l'artefact, axes, découpage en déciles, formule du lift et campagnes traitées avec les deux graphiques côte à côte. Les deux courbes appartiennent à la pratique du marketing direct, qui les emploie depuis les années 1990, et cette communication en documente la forme reçue.
- Fawcett, T., An Introduction to ROC Analysis, Pattern Recognition Letters, 27(8), 2006, pp. 861-874: la logique de classement et de seuil commune à toutes ces évaluations, ainsi que la diagonale comme référence du tirage au hasard.
- Provost, F. et Fawcett, T., Robust Classification for Imprecise Environments, Machine Learning, 42(3), 2001, pp. 203-231: le socle du choix de seuil par la valeur attendue, quand les coûts de mauvais classement et la distribution des classes sont incertains.
- Provost, F. et Fawcett, T., Data Science for Business, O'Reilly, 2013, ch. 8: la courbe de profit comme artefact de décision d'affaires et le cadrage du modèle comme outil de classement. Ouvrage de synthèse pour ces deux apports.

