BazEkon - Biblioteka Główna Uniwersytetu Ekonomicznego w Krakowie

BazEkon home page

Meny główne

Autor
Skwirz Wojciech (Warsaw School of Economics)
Tytuł
Feature Selection Methods for Cox Proportional Hazards Model. Comparative Study for Financial and Medical Survival Data
Metody doboru zmiennych objaśniających do modelu proporcjonalnych hazardów Coxa. Analiza porównawcza dla danych z sektora finansowego i medycznego
Źródło
Bank i Kredyt, 2025, nr 1, s. 113-137, aneks, bibliogr. s. 125-127
Bank & Credit
Słowa kluczowe
Analiza przeżycia, Dobór zmiennych, Ryzyko kredytowe, Dane medyczne, Sektor finansowy
Survival analysis, Variables selection, Credit risk, Medical data, Financial sector
Uwagi
Klasyfikacja JEL: C24, C41, C52, C55, G21, I10
streszcz., summ.
Abstrakt
Celem niniejszego badania jest analiza porównawcza technik doboru zmiennych do modelu proporcjonalnych hazardów Coxa. Modelowanie czasu trwania jest dziedziną szczególnie rozwiniętą w naukach medycznych, w których wykorzystuje się je m.in. do badania przeżywalności pacjentów od momentu zdiagnozowania choroby lub do analizy skuteczności terapii określonymi lekami. Wykorzystanie analizy przeżycia w sektorze finansowym jest jednak stosunkowo rzadkie. Międzynarodowy Standard Sprawozdawczości Finansowej 9 (MSSF9) narzucił na banki obowiązek tworzenia odpisów z tytułu ryzyka kredytowego. Zgodnie z MSSF9 każda ekspozycja kredytowa powinna być przyporządkowana do jednej z czterech grup (koszyków, ang. stage). Szczególnym przypadkiem jest koszyk drugi, gdzie oczekiwane straty kredytowe (ECL) muszą być wyznaczane w horyzoncie zapadalności kredytu. Banki samodzielnie tworzą metodyki wyliczania ECL, dopasowane do specyfiki ich działalności i jednocześnie zgodne z wytycznymi zawartymi w MSSF9. Praktyka rynkowa pokazuje, że wymóg modelowania strat kredytowych w całym horyzoncie życia kredytu jest spełniony dzięki odpowiednim modyfikacjom punktowego wskazania modeli klasyfikacyjnych zbudowanych na 12-miesięcznym oknie obserwacji i wykorzystywanych w innych procesach decyzyjnych banku. Praktyka taka, choć zgodna z regulacjami, może prowadzić do tworzenia modeli przeżycia nieoptymalnych z punktu widzenia mocy predykcyjnej. Odrębny dobór zmiennych objaśniających i wykorzystanie modelu proporcjonalnych hazardów Coxa (jako narzędzia łatwo interpretowalnego i ugruntowanego w literaturze) umożliwia poprawę jakości modeli w banku. Dostępne są nieliczne pozycje literatury prezentujące analizy porównawcze metod doboru zmiennych objaśniających do modeli przeżycia w obszarze medycznym. Brak jest natomiast literatury porównującej takie algorytmy jednocześnie na danych finansowych i medycznych. W niniejszym badaniu opracowano implementacje ośmiu algorytmów doboru zmiennych do modeli Coxa. Trzy z nich bazowały na metodzie krokowej (ang. forward), w której zmienne dodawano sekwencyjnie, maksymalizując wybraną statystykę: kryterium informacyjne Akaike, kryterium informacyjne Schwarza lub indeks zgodności (ang. concordance index). Oprócz tego przeprowadzono dobór zmiennych (w dwóch wariantach), bazując na analizie głównych składowych. Dodatkowo wykorzystano metodę podziału i ograniczeń (ang. best subset selection), regularyzację LASSO oraz losowy las przeżycia (ang. random survival forest). (skrócony abstrakt oryginalny)

This study compares Cox proportional hazards models across medical and financial datasets built using various feature selection techniques. In this analysis 8 feature selection techniques (3 variants of forward selection, 2 variants of a selection based on principal component analysis, selection based on random survival forest, best subset selection and a selection based on a LASSO regularization) were tested across 22 multidimensional datasets (2 financial and 20 medical). The resulting Cox models were compared based on a concordance index. The main hypothesis of this study stating that the LASSO regularization or the selection based on random survival forest method (generating good models for medical data) would yield similar performance on financial data, was hereby disproved. The forward Schwarz and best subset selection gave the best results for financial data, while LASSO and random survival forest proved to be the most efficient in medical setting, for each considered model size. (original abstract)
Dostępne w
Biblioteka Główna Uniwersytetu Ekonomicznego w Katowicach
Pełny tekst
Pokaż
Bibliografia
Pokaż
  1. Aalen O. (1978), Nonparametric inference for a family of counting processes, The Annals of Statisti 6(4), 701-726.
  2. Al Kandari N.M., Jolliffe I.T. (2005), Variable selection and interpretation of correlation princii component, Environmetrics, 16, 659-672.
  3. Allison P.D. (2010), Survival Analysis Using SAS. A Practical Guide, SAS Institute.
  4. Altmann A., Tolo§i L., Sander O., Lengauer T. (2010), Permutation importance: a corrected featu importance measure, Bioinformatics, 26(10), 1340-1347.
  5. Bommert A., Welchowski T., Schmid M., Rahnenführer J. (2022), Benchmark of filter methods 1 feature selection in high-dimensional gene expression survival data, Briefings in Bioinformati 23(1), bbab354.
  6. Borucka J. (2017), Analiza i modelowanie ryzyka zachorowalności: parametryczne i semiparametrycz modele przeżycia, Oficyna Wydawnicza SGH.
  7. Bozdogan H. (1987), Model selection and Akaike's Information Criterion (AIC): the general theory a its analytical extensions, Psychometrika, 52, 345-370.
  8. Breiman L. (2001), Random forests, Machine Learninng, 45, 5-32.
  9. Cox D.R. (1958), The regression analysis of binary sequences, Journal of the Royal Statistical Society, Series B (Methodological), 20(2), 215-242.
  10. Cox D.R. (1972), Regression models and life-tables, Journal of the Royal Statistical Society. Series B (Methodological), 34(2), 187-220.
  11. Cox D.R. (1975), Partial likelihood, Biometrika, 62(2), 269-276.
  12. Dirick L., Claeskens G., Baesens B. (2017), Time to default in credit scoring using survival analysis: a benchmark study, Journal of the Operational Research Society, 68, 652-665.
  13. Drysdale E. (2022), SurvSet: an open-source time-to-event dataset repository, ArXiv, abs/2203.03094.
  14. Furnival G., Wilson R. (1974), Regressions by leaps and bounds, Technometrics, 16(4), 499-511.
  15. Gerds T.A., Schumacher M. (2006), Consistent estimation of the expected brier score in general survival models with right censored event times, Biometrical Journal, 48(6), 1029-1040.
  16. Guyon I., Elisseeff A. (2003), An introduction to variable and feature selection, Journal of Machine Learning Research, 3, 1157-1182.
  17. Harrell Jr. F.E., Califf R.M., Pryor D.B., Lee K.L., Rosati R.A. (1982), Evaluating the yield of medical tests, Journal of the American Medical Association, 247(18), 2543-2546.
  18. Heinze G., Wallisch C., Dunkler D. (2018), Variable selection - a review and recommendations for the practicing statistician, Biometrical Journal, 60(3), 431-449.
  19. Herrmann M., Probst P., Hornung R., Jurinovic V., Boulesteix A.L. (2021), Large-scale benchmark study of survival prediction methods using multi-omics data, Briefings in Bioinformatics, 22(3), bbaa167.
  20. Hosmer D.W., Lemeshow S., May S. (2008), Applied Survival Analysis. Regression Modeling of Time-to-event Data, Wiley.
  21. Ishwaran H., Kogalur U.B., Blackstone E.H., Lauer M.S. (2008), Random survival forests, The Annals of Applied Statistics, 2(3), 841-860.
  22. Kantidakis G., Putter H., Lancia C., Boer J., Braat A.E., Fiocco M. (2020), Survival prediction models since liver transplantation - comparisons between Cox models and machine learning techniques, BMC Medical Research Methodology, 20(1), 277.
  23. Kar i., Kocaman G., ibrahimov F., Enön S., Co§gun E., Elhan A.H. (2023), Comparison of deep learning-based recurrence-free survival with random survival forest and Cox proportional hazard models in Stage-I NSCLC patients, Cancer Medicine, 12(18), 19272-19278.
  24. Lang M., Kotthaus H., Marwedel P., Weihs C., Rahnenführer J., Bischl B. (2015), Automatic model selection for high-dimensional survival analysis, Journal of Statistical Computation and Simulation, 85(1), 62-76.
  25. de Leeuw J., Hornik K., Mair P. (2009), Isotone optimization in R: Pool-Adjacent-Violators Algorithm (PAVA) and active set methods, Journal of Statistical Software, 32(55), 1-24.
  26. McWilliam A., Khalifa J., Vasquez Osorio E., Banfill K., Abravan A., Faivre-Finn C., van Herk M. (2020), Novel methodology to investigate the effect of radiation dose to heart substructures on overall survival, International Journal of Radiation Oncology, Biology, Physics, 108(4), 1073-1081.
  27. Mishra S. (2022), A comparative study for time-to-event analysis and survival prediction for heart failure condition using machine learning techniques, Journal of Electronics, Electromedical Engineering, and Medical Informatics, 4(3), 115-134.
  28. Moncada-Torres A., van Maaren M.C., Hendriks M.P., Siesling S., Geleijnse G. (2021), Explainable machine learning can outperform Cox regression predictions and provide insights in breast cancer survival, Scientific Reports, 11, 1-13.
  29. Petersson S., Sehlstedt K. (2018), Variable Selection Techniques for the Cox Proportional Hazards Model: A Comparative Study, University of Gothenburg, School of Business, Economics and Law.
  30. Pölsterl S. (2020), Scikit-survival: a library for time-to-event analysis built on top of scikit-learn, Journal of Machine Learning Research, 21(212), 1-6.
  31. Przanowski K. (2011), Banking retail consumer finance data generator - credit scoring data repository, Finansowy Kwartalnik Internetowy e-Finanse, 9, 44-59.
  32. Rizopoulos D., Molenberghs G., Lesaffre E.M. (2017), Dynamic predictions with time-dependent covariates in survival analysis using joint modeling and landmarking, Biometrical Journal, 59(9), 1261-1276.
  33. Sauerbrei W., Perperoglou A., Schmid M., Abrahamowicz M., Becher H., Binder H., Dunkler D., Harrell Jr F.E., Royston P., Heinze G. (2020), State of the art in selection of variables and functional forms in multivariable analysis - outstanding issues, Diagnostic and Prognostic Research, 4, 3.
  34. Schwarz G. (1978), Estimating the dimension of a model, The Annals of Statistics, 6(2), 461-464.
  35. Sikora M., Wróbel L., Gudyś A. (2018), GuideR: a guided separate-and-conquer rule learning in classification, regression, and survival settings, Knowledge-Based Systems, 173, 1-14.
  36. Spooner A., Chen E., Sowmya A., Sachdev P., Kochan N.A., Trollor J., Brodaty H. (2020), A comparison of machine learning methods for survival analysis of high-dimensional clinical data for dementia prediction, Scientific Reports, 10, 20410.
  37. Tibshirani R. (1996), Regression shrinkage and selection via the Lasso, Journal of the Royal Statistical Society. Series B (Methodological), 58(1), 267-288.
  38. Tibshirani R. (1997), The Lasso method for variable selection in the Cox model, Statistics in Medicine, 16(4), 385-395.
  39. Vinga S. (2021), Structured sparsity regularization for analyzing high-dimensional omics data, Briefings in Bioinformatics, 22(1), 77-87.
  40. Voges L.F., Jarren L.C., Seifert S. (2023), Exploitation of surrogate variables in random forests for unbiased analysis of mutual impact and importance of features, Bioinformatics, 39(8), btad471.
Cytowane przez
Pokaż
ISSN
0137-5520
Język
eng
URI / DOI
http://dx.doi.org/10.5604/01.3001.0054.9612
Udostępnij na Facebooku Udostępnij na Twitterze Udostępnij na Google+ Udostępnij na Pinterest Udostępnij na LinkedIn Wyślij znajomemu