INPUT
SYGNAŁY DOSTĘPNE PRZY INFERENCJI
Metadane oferty, ustrukturyzowana analiza V4 oraz kanoniczny surowy tytuł i opis są dostępne przed ręcznym przeglądem.
SYSTEM R1
REPRODUKOWALNE ML / UCZENIE PREFERENCJI / EWALUACJA MODELI
Kontrolowane badania machine learning nad przewidywaniem rzeczywistych decyzji APPLY / MAYBE / REJECT na podstawie automatycznie dostępnych sygnałów z ofert oprogramowania.
TOŻSAMOŚĆ SYSTEMU
ID SYSTEMUOFFER-PERSONALIZATION-ML-R1
STATUSZAKOŃCZONY EKSPERYMENT / R&D
TYPBADANIA MACHINE LEARNING
Zakończony, reprodukowalny eksperyment badawczy — nie produkcyjny system ML.
01 / PRZEGLĄD
Badanie sprawdza, czy sygnały dostępne przed ręcznym przeglądem potrafią przewidzieć rzeczywistą decyzję APPLY, MAYBE lub REJECT konkretnego użytkownika wobec oferty oprogramowania. Jego wartością jest rygor eksperymentalny: zamrożony zbiór, wspólne foldy, predykcje out-of-fold, preprocessing z kontrolą leakage oraz formalny benchmark parowany.
Wynik celowo nie jest przedstawiony zero-jedynkowo. Dodanie tekstu leksykalnego poprawiło kilka metryk dyskryminacji i jakości prawdopodobieństw, ale nie poprawiło zbalansowanej jakości wieloklasowej. MAYBE pozostało głównym obszarem błędu.
02 / PYTANIE BADAWCZE
Czy automatycznie obserwowalne cechy oferty potrafią przewidzieć APPLY, MAYBE lub REJECT dla konkretnego użytkownika i procesu pracy?
INPUT
Metadane oferty, ustrukturyzowana analiza V4 oraz kanoniczny surowy tytuł i opis są dostępne przed ręcznym przeglądem.
TARGET
Decyzje człowieka APPLY / MAYBE / REJECT stanowią target uczenia nadzorowanego.
EXCLUDED
Notatki, uzasadnienia, oceny człowieka, stan procesu i tożsamość klienta nie są cechami modelu.
03 / ZBIÓR DANYCH
OCENIONE OFERTY
146
PEŁNY ZAMROŻONY ZBIÓR OCENIONYCH OFERT
PRZYKŁADY DO TRENINGU
123
23 WYKLUCZONE Z POWODU BRAKU UŻYTECZNEJ ANALIZY V4
LICZEBNOŚĆ APPLY
54
LICZEBNOŚĆ MAYBE
11
KLASA MNIEJSZOŚCIOWA / NIEJEDNOZNACZNA
LICZEBNOŚĆ REJECT
58
FINGERPRINT / SCHEMAT V2 93bac8da8aeeb2899af63fe8d6ed860f903732dbc2c329cc3d91420e43e80244
Schemat v2 obejmuje surowy tytuł i opis oferty w tożsamości zbioru. Notatki oraz uzasadnienia z oceny człowieka pozostają materiałem nadzorującym, a nie cechami modelu dostępnymi przy inferencji.
04 / PROJEKT EKSPERYMENTU
E1 i E2 wykorzystują te same 123 przykłady, ten sam przygotowany przydział do foldów, tę samą konfigurację klasyfikatora i ewaluację out-of-fold. Porównanie izoluje wartość leksykalnej reprezentacji tekstu, zamiast zmieniać kilka zmiennych jednocześnie.
05 / E1 BAZOWY MODEL USTRUKTURYZOWANY
CECHY USTRUKTURYZOWANE
31
DOKŁADNOŚĆ OOF
0.691057
MACRO-F1 OOF
0.553961
WEIGHTED-F1 OOF
0.696732
ROC-AUC
0.682106
LOG LOSS ↓
0.923421
MODEL
C=1.0 / class_weight=balanced / solver=liblinear / max_iter=2000 / random_state=42
VALIDATION
StratifiedKFold z włączonym tasowaniem i random_state=42.
REPREZENTACJA
Do modelu trafiają wyłącznie automatycznie dostępne sygnały z oferty i analizy ustrukturyzowanej.
06 / WRAŻLIWOŚĆ NA PODZIAŁ
STRATYFIKOWANE MACRO-F1
0.553961
REFERENCYJNA EWALUACJA 5-FOLD
MACRO-F1 GRUPOWANE PO KLIENCIE
0.554107
PRAKTYCZNIE BEZ ZMIANY
TEMPORALNE MACRO-F1
0.469055
ISTOTNY SPADEK
TEMPORALNE F1 DLA MAYBE
0.000000
WIDOCZNE ZAŁAMANIE KLASY
Macro-F1 w podziale grupowanym po kliencie pozostało praktycznie bez zmian, co daje niewiele przesłanek, że powtarzająca się tożsamość klienta napędza wynik. Nie jest to dowód braku leakage.
Temporalna ewaluacja expanding-window objęła 117 próbek OOF i wykazała istotny spadek; F1 dla MAYBE obniżyło się do 0,0. Wykorzystano bieżący zamrożony, znormalizowany snapshot ofert, więc badanie mierzy wrażliwość na podział temporalny i generalizację — nie ścisłą rekonstrukcję point-in-time.
Artefakty grupowane i temporalne wykonano według poprzedniego kontraktu fingerprintu. E1 ponownie wytrenowano w schemacie fingerprint v2 i dokładnie odtworzono metryki stratyfikowane; badań grupowanych i temporalnych nie uruchamiano ponownie w v2.
07 / E2 CECHY USTRUKTURYZOWANE + TF-IDF
CECHY USTRUKTURYZOWANE
31
DOKŁADNOŚĆ OOF
0.723577
MACRO-F1 OOF
0.552036
WEIGHTED-F1 OOF
0.714806
ROC-AUC
0.694671
LOG LOSS ↓
0.843437
TEXT
lowercase=true / ngram_range=(1,2) / min_df=2 / max_df=0.95
SPACE
max_features=5000 / sublinear_tf=true / norm=l2 / strip_accents=None
LEAKAGE
Słownik i IDF są uczone wewnątrz każdego folda treningowego, nigdy na pełnym zbiorze.
08 / BENCHMARK PAROWANY
Benchmark: offer_personalization_e1_vs_e2_stratified. Wszystkie delty mają konwencję E2 - E1, również dla metryk, w których mniej znaczy lepiej. Metryką rankingową jest macro-F1.
| METRYKA | E1 | E2 | DELTA / E2 - E1 |
|---|---|---|---|
| MACRO-F1 | 0.553961 | 0.552036 | -0.001925PRAKTYCZNIE BEZ ZMIANY |
| DOKŁADNOŚĆ | 0.691057 | 0.723577 | +0.032520POPRAWA |
| WEIGHTED-F1 | 0.696732 | 0.714806 | +0.018074POPRAWA |
| ROC-AUC | 0.682106 | 0.694671 | +0.012566POPRAWA |
| ŚREDNIA PRECYZJA | 0.523307 | 0.538060 | +0.014753POPRAWA |
| LOG LOSS ↓ | 0.923421 | 0.843437 | -0.079984POPRAWA |
| BRIER SCORE ↓ | 0.505426 | 0.462909 | -0.042517POPRAWA |
| ECE ↓ | 0.112989 | 0.128552 | +0.015562POGORSZENIE |
09 / ANALIZA KLAS
| METRYKA | E1 | E2 | DELTA / E2 - E1 |
|---|---|---|---|
| APPLY | 0.792793 | 0.796460 | +0.003667PRAKTYCZNIE BEZ ZMIANY |
| MAYBE | 0.160000 | 0.105263 | -0.054737POGORSZENIE |
| ODRZUĆ | 0.709091 | 0.754386 | +0.045295POPRAWA |
APPLYSTABILNE
MAYBEPOGORSZENIE / GŁÓWNY OBSZAR BŁĘDU
ODRZUĆISTOTNA POPRAWA
10 / KLUCZOWY WNIOSEK
11 / REPRODUKOWALNOŚĆ
REP-01
Niezmienna tożsamość zbioru jednoznacznie określa oceniany zestaw próbek.
REP-02
Przygotowany przydział 5-fold jest stabilny i reprodukowalny.
REP-03
Oba eksperymenty są porównywane dokładnie na tych samych wierszach walidacyjnych.
REP-04
Słownik TF-IDF i IDF są dopasowywane wyłącznie na każdym foldzie treningowym.
REP-05
Każdy oceniany wiersz treningowy jest przewidywany przez model, który nie trenował na tym wierszu.
REP-06
Zserializowane modele są ponownie ładowane i walidowane względem oczekiwanych predykcji.
REP-07
Ewaluacja i porównanie działają na niezmiennych plikach eksperymentu.
REP-08
Trening i ewaluacja nie modyfikują bazy danych aplikacji.
REP-09
E1, E2 oraz formalny BenchmarkResult pozostają niezależnie sprawdzalnymi artefaktami.
12 / OGRANICZENIA
Do treningu nadają się tylko 123 przykłady, w tym zaledwie 11 przykładów MAYBE.
Niejednoznaczność etykiet nadawanych przez człowieka jest głównym źródłem niepewności.
Walidacja temporalna wykazuje istotny spadek, w tym F1 dla MAYBE równe 0,0.
Badanie temporalne nie jest ścisłym historycznym backtestem point-in-time.
Nie przeprowadzono strojenia hiperparametrów ani progów decyzyjnych.
Nie przeprowadzono eksperymentu z embeddingami ani transformerem.
Eksperyment nie dowodzi gotowości produkcyjnej.
Przedstawione metryki nie dowodzą istotności statystycznej.
13 / DALSZA STRATEGIA DANYCH
Najbardziej wartościowym kolejnym krokiem nie jest model E3. Jest nim zebranie większej liczby niezależnie ocenionych ofert, szczególnie przypadków blisko granic decyzji APPLY ↔ MAYBE oraz MAYBE ↔ REJECT.
Jeżeli potrzebny będzie ścisły backtest point-in-time, należy również zachowywać historyczne snapshoty cech. Po powiększeniu zbioru ten sam zamrożony kontrakt benchmarku można uruchomić ponownie pod nowym fingerprintem.