W tytule bynajmniej nie o piwnych geekach. Zasadniczo to samo co na poprzednim Scatter Plot log-log, tylko że inaczej. I kłamliwie w pewnym sensie… w każdym razie na start Contour Plot (wykres warstwowy / poziomicowy czy jak tam po naszemu) a właściwie dwa na jednym obrazku. A dalej to już wolna amerykanka, czyli wyliczona 4ema algorytmami heatmapa PL/Zagr vel mapa balansu klas vel gradient klasowy vel pewnie jeszcze ileśtam potencjalnych nazw. Poprosiłem LLMa o mega skrótowe opisy co to za algorytmy:

KDE (Kernel Density Estimation) — dla każdej klasy liczy „chmurę gęstości” wokół jej punktów, a potem porównuje, która chmura jest gęstsza w danym miejscu. Prosty i szybki, ale w pustych rejonach potrafi ekstrapolować w mylący sposób, bo patrzy na globalny kształt całej chmury, nie na najbliższe punkty.

IDW / k-NN (ważenie odległością) — w każdym punkcie pyta „jakiego koloru jest kilkunastu najbliższych sąsiadów” i uśrednia ich głosy, dając większą wagę bliższym. Bardzo intuicyjny i lokalny — wynik zawsze podąża za najbliższymi danymi, nawet daleko od głównego skupiska.

SVM (Support Vector Machine) — szuka najlepszej „linii podziału” między dwiema klasami, dopuszczając jej wyginanie się (dzięki jądru RBF) tam, gdzie dane tego wymagają. Dobrze radzi sobie z wyraźnym oddzieleniem grup, ale nie daje probabilistycznej pewności — tylko odległość od granicy.

GPC (Gaussian Process Classification) — podobny w duchu do SVM, ale zamiast twardej granicy zwraca prawdopodobieństwo przynależności do klasy w każdym punkcie, z naturalnym uwzględnieniem niepewności tam, gdzie danych jest mało. Najbardziej „statystycznie uczciwy”

A żeby nie było za prosto, to zrobione matryce poprzez modyfikację dwóch kluczowych parametrów dla każdego z algorytmów.

I zasadniczo – żaden z nich nie kłamie, po prostu trzeba umieć wybrać. Do decyzji wybierającego: albo ten, który najlepiej przedstawia sytuację, albo ten, który najbardziej popiera jakąś tam naszą tezę czy przekonanie. Ja pozwolę sobie nie wybierać mimo, że niektóre całkiem ładne 🙂