← WRÓĆ DO MAPY SYSTEMU

SYSTEM R1

OFFER PERSONALIZATION ML R&D

REPRODUKOWALNE ML / UCZENIE PREFERENCJI / EWALUACJA MODELI

Kontrolowane badania machine learning nad przewidywaniem rzeczywistych decyzji APPLY / MAYBE / REJECT na podstawie automatycznie dostępnych sygnałów z ofert oprogramowania.

PYTHONSCIKIT-LEARNREGRESJA LOGISTYCZNATF-IDFEWALUACJA MODELIHUMAN-IN-THE-LOOP

TOŻSAMOŚĆ SYSTEMU

ID SYSTEMUOFFER-PERSONALIZATION-ML-R1

STATUSZAKOŃCZONY EKSPERYMENT / R&D

TYPBADANIA MACHINE LEARNING

Zakończony, reprodukowalny eksperyment badawczy — nie produkcyjny system ML.

01 / PRZEGLĄD

UCZENIE PREFERENCJI JAKO KONTROLOWANY EKSPERYMENT

Badanie sprawdza, czy sygnały dostępne przed ręcznym przeglądem potrafią przewidzieć rzeczywistą decyzję APPLY, MAYBE lub REJECT konkretnego użytkownika wobec oferty oprogramowania. Jego wartością jest rygor eksperymentalny: zamrożony zbiór, wspólne foldy, predykcje out-of-fold, preprocessing z kontrolą leakage oraz formalny benchmark parowany.

Wynik celowo nie jest przedstawiony zero-jedynkowo. Dodanie tekstu leksykalnego poprawiło kilka metryk dyskryminacji i jakości prawdopodobieństw, ale nie poprawiło zbalansowanej jakości wieloklasowej. MAYBE pozostało głównym obszarem błędu.

02 / PYTANIE BADAWCZE

CO MOŻNA WIEDZIEĆ PRZED OCENĄ CZŁOWIEKA?

Czy automatycznie obserwowalne cechy oferty potrafią przewidzieć APPLY, MAYBE lub REJECT dla konkretnego użytkownika i procesu pracy?

INPUT

SYGNAŁY DOSTĘPNE PRZY INFERENCJI

Metadane oferty, ustrukturyzowana analiza V4 oraz kanoniczny surowy tytuł i opis są dostępne przed ręcznym przeglądem.

TARGET

NADZÓR CZŁOWIEKA

Decyzje człowieka APPLY / MAYBE / REJECT stanowią target uczenia nadzorowanego.

EXCLUDED

BEZ LEAKAGE Z RECENZJI

Notatki, uzasadnienia, oceny człowieka, stan procesu i tożsamość klienta nie są cechami modelu.

03 / ZBIÓR DANYCH

MAŁY, ZAMROŻONY I JEDNOZNACZNIE ZIDENTYFIKOWANY

OCENIONE OFERTY

146

PEŁNY ZAMROŻONY ZBIÓR OCENIONYCH OFERT

PRZYKŁADY DO TRENINGU

123

23 WYKLUCZONE Z POWODU BRAKU UŻYTECZNEJ ANALIZY V4

LICZEBNOŚĆ APPLY

54

LICZEBNOŚĆ MAYBE

11

KLASA MNIEJSZOŚCIOWA / NIEJEDNOZNACZNA

LICZEBNOŚĆ REJECT

58

FINGERPRINT / SCHEMAT V2 93bac8da8aeeb2899af63fe8d6ed860f903732dbc2c329cc3d91420e43e80244

Schemat v2 obejmuje surowy tytuł i opis oferty w tożsamości zbioru. Notatki oraz uzasadnienia z oceny człowieka pozostają materiałem nadzorującym, a nie cechami modelu dostępnymi przy inferencji.

04 / PROJEKT EKSPERYMENTU

JEDEN ZBIÓR, JEDEN KONTRAKT PODZIAŁU, DWIE REPREZENTACJE

PRZEPŁYW KONTROLOWANEGO PORÓWNANIA
OFERTY HISTORYCZNE
ZAMROŻONY ZBIÓR DANYCH
WSPÓLNE DETERMINISTYCZNE FOLDY
E1 CECHY USTRUKTURYZOWANE31 CECHPREDYKCJE OOF
E2 CECHY USTRUKTURYZOWANE + TEKST31 CECH + TF-IDFPREDYKCJE OOF
FORMALNY BENCHMARK PAROWANY

E1 i E2 wykorzystują te same 123 przykłady, ten sam przygotowany przydział do foldów, tę samą konfigurację klasyfikatora i ewaluację out-of-fold. Porównanie izoluje wartość leksykalnej reprezentacji tekstu, zamiast zmieniać kilka zmiennych jednocześnie.

05 / E1 BAZOWY MODEL USTRUKTURYZOWANY

INTERPRETOWALNY BAZOWY MODEL USTRUKTURYZOWANY

CECHY USTRUKTURYZOWANE

31

DOKŁADNOŚĆ OOF

0.691057

MACRO-F1 OOF

0.553961

WEIGHTED-F1 OOF

0.696732

ROC-AUC

0.682106

LOG LOSS ↓

0.923421

MODEL

REGRESJA LOGISTYCZNA ONE-VS-REST

C=1.0 / class_weight=balanced / solver=liblinear / max_iter=2000 / random_state=42

VALIDATION

5-FOLD STRATYFIKOWANE OOF

StratifiedKFold z włączonym tasowaniem i random_state=42.

REPREZENTACJA

31 CECH USTRUKTURYZOWANYCH

Do modelu trafiają wyłącznie automatycznie dostępne sygnały z oferty i analizy ustrukturyzowanej.

06 / WRAŻLIWOŚĆ NA PODZIAŁ

ZAŁOŻENIA WALIDACJI ZMIENIAJĄ OBRAZ

STRATYFIKOWANE MACRO-F1

0.553961

REFERENCYJNA EWALUACJA 5-FOLD

MACRO-F1 GRUPOWANE PO KLIENCIE

0.554107

PRAKTYCZNIE BEZ ZMIANY

TEMPORALNE MACRO-F1

0.469055

ISTOTNY SPADEK

TEMPORALNE F1 DLA MAYBE

0.000000

WIDOCZNE ZAŁAMANIE KLASY

Macro-F1 w podziale grupowanym po kliencie pozostało praktycznie bez zmian, co daje niewiele przesłanek, że powtarzająca się tożsamość klienta napędza wynik. Nie jest to dowód braku leakage.

Temporalna ewaluacja expanding-window objęła 117 próbek OOF i wykazała istotny spadek; F1 dla MAYBE obniżyło się do 0,0. Wykorzystano bieżący zamrożony, znormalizowany snapshot ofert, więc badanie mierzy wrażliwość na podział temporalny i generalizację — nie ścisłą rekonstrukcję point-in-time.

Artefakty grupowane i temporalne wykonano według poprzedniego kontraktu fingerprintu. E1 ponownie wytrenowano w schemacie fingerprint v2 i dokładnie odtworzono metryki stratyfikowane; badań grupowanych i temporalnych nie uruchamiano ponownie w v2.

07 / E2 CECHY USTRUKTURYZOWANE + TF-IDF

TEKST LEKSYKALNY DODANY Z KONTROLĄ LEAKAGE

CECHY USTRUKTURYZOWANE

31

DOKŁADNOŚĆ OOF

0.723577

MACRO-F1 OOF

0.552036

WEIGHTED-F1 OOF

0.714806

ROC-AUC

0.694671

LOG LOSS ↓

0.843437

TEXT

N-GRAMY SŁÓW

lowercase=true / ngram_range=(1,2) / min_df=2 / max_df=0.95

SPACE

OGRANICZONY SŁOWNIK

max_features=5000 / sublinear_tf=true / norm=l2 / strip_accents=None

LEAKAGE

DOPASOWANIE WEWNĄTRZ FOLDA TRENINGOWEGO

Słownik i IDF są uczone wewnątrz każdego folda treningowego, nigdy na pełnym zbiorze.

08 / BENCHMARK PAROWANY

FORMALNE PORÓWNANIE E1 I E2

Benchmark: offer_personalization_e1_vs_e2_stratified. Wszystkie delty mają konwencję E2 - E1, również dla metryk, w których mniej znaczy lepiej. Metryką rankingową jest macro-F1.

FORMALNY BENCHMARK PAROWANY — 123 WSPÓLNE PRÓBKI
METRYKAE1E2DELTA / E2 - E1
MACRO-F10.5539610.552036-0.001925PRAKTYCZNIE BEZ ZMIANY
DOKŁADNOŚĆ0.6910570.723577+0.032520POPRAWA
WEIGHTED-F10.6967320.714806+0.018074POPRAWA
ROC-AUC0.6821060.694671+0.012566POPRAWA
ŚREDNIA PRECYZJA0.5233070.538060+0.014753POPRAWA
LOG LOSS ↓0.9234210.843437-0.079984POPRAWA
BRIER SCORE ↓0.5054260.462909-0.042517POPRAWA
ECE ↓0.1129890.128552+0.015562POGORSZENIE

09 / ANALIZA KLAS

POPRAWA NIE OBJĘŁA KAŻDEJ KLASY

PORÓWNANIE F1 DLA POSZCZEGÓLNYCH KLAS
METRYKAE1E2DELTA / E2 - E1
APPLY0.7927930.796460+0.003667PRAKTYCZNIE BEZ ZMIANY
MAYBE0.1600000.105263-0.054737POGORSZENIE
ODRZUĆ0.7090910.754386+0.045295POPRAWA

APPLYSTABILNE

MAYBEPOGORSZENIE / GŁÓWNY OBSZAR BŁĘDU

ODRZUĆISTOTNA POPRAWA

10 / KLUCZOWY WNIOSEK

LEPSZY SYGNAŁ TEKSTOWY, NIEROZWIĄZANA JAKOŚĆ ZBALANSOWANA

11 / REPRODUKOWALNOŚĆ

EKSPERYMENT MOŻNA SPRAWDZIĆ I POWTÓRZYĆ

REP-01

FINGERPRINT ZAMROŻONEGO ZBIORU

Niezmienna tożsamość zbioru jednoznacznie określa oceniany zestaw próbek.

REP-02

DETERMINISTYCZNY PRZYDZIAŁ DO FOLDÓW

Przygotowany przydział 5-fold jest stabilny i reprodukowalny.

REP-03

IDENTYCZNE FOLDY E1 / E2

Oba eksperymenty są porównywane dokładnie na tych samych wierszach walidacyjnych.

REP-04

PREPROCESSING WEWNĄTRZ FOLDÓW

Słownik TF-IDF i IDF są dopasowywane wyłącznie na każdym foldzie treningowym.

REP-05

PREDYKCJE OOF

Każdy oceniany wiersz treningowy jest przewidywany przez model, który nie trenował na tym wierszu.

REP-06

ROUNDTRIP JOBLIB

Zserializowane modele są ponownie ładowane i walidowane względem oczekiwanych predykcji.

REP-07

EWALUACJA WYŁĄCZNIE Z PLIKÓW

Ewaluacja i porównanie działają na niezmiennych plikach eksperymentu.

REP-08

BAZA DANYCH BEZ ZMIAN

Trening i ewaluacja nie modyfikują bazy danych aplikacji.

REP-09

ODDZIELNE ARTEFAKTY

E1, E2 oraz formalny BenchmarkResult pozostają niezależnie sprawdzalnymi artefaktami.

12 / OGRANICZENIA

CZEGO TEN WYNIK NIE DOWODZI

  • 01

    Do treningu nadają się tylko 123 przykłady, w tym zaledwie 11 przykładów MAYBE.

  • 02

    Niejednoznaczność etykiet nadawanych przez człowieka jest głównym źródłem niepewności.

  • 03

    Walidacja temporalna wykazuje istotny spadek, w tym F1 dla MAYBE równe 0,0.

  • 04

    Badanie temporalne nie jest ścisłym historycznym backtestem point-in-time.

  • 05

    Nie przeprowadzono strojenia hiperparametrów ani progów decyzyjnych.

  • 06

    Nie przeprowadzono eksperymentu z embeddingami ani transformerem.

  • 07

    Eksperyment nie dowodzi gotowości produkcyjnej.

  • 08

    Przedstawione metryki nie dowodzą istotności statystycznej.

13 / DALSZA STRATEGIA DANYCH

WIĘCEJ NIEZALEŻNYCH DANYCH PRZED ZWIĘKSZANIEM ZŁOŻONOŚCI MODELU

Najbardziej wartościowym kolejnym krokiem nie jest model E3. Jest nim zebranie większej liczby niezależnie ocenionych ofert, szczególnie przypadków blisko granic decyzji APPLY ↔ MAYBE oraz MAYBE ↔ REJECT.

Jeżeli potrzebny będzie ścisły backtest point-in-time, należy również zachowywać historyczne snapshoty cech. Po powiększeniu zbioru ten sam zamrożony kontrakt benchmarku można uruchomić ponownie pod nowym fingerprintem.