- Hierarchické shlukování organizuje data do stromové struktury zvané dendrogram, čímž se eliminuje nutnost přednastavovat počet shluků.
- AGNES vytváří klastry zdola nahoru pomocí iterativního slučování, zatímco DIANA rozděluje jednu velkou skupinu shora dolů.
- Kvalita klastrů se posuzuje pomocí interních metrik, jako je Davies-Bouldinův index, nebo externích srovnání prostřednictvím metod Precision a Recall.
Měli jste někdy pocit, že zíráte na horu dat a mezi stromy prostě nevidíte les? A právě zde přichází na řadu shlukování. V podstatě se jedná o umění seskupování datových bodů na základě toho, jak si jsou podobné , čímž se zajistí, že věci uvnitř skupiny jsou těsně propojené, zatímco samotné skupiny zůstávají od sebe vzdálené. Je to základní kámen strojového učení bez dozoru, což znamená, že počítač nachází vzory, aniž by mu bylo předem řečeno, co má hledat.
I když existuje mnoho způsobů, jak data rozdělit na segmenty, hierarchické shlukování je poněkud specifické. Místo pouhého výběru náhodného počtu skupin vytváří vnořenou strukturu, která vypadá jako rodokmen . Ať už se snažíte diverzifikovat akciové portfolio nebo segmentovat svou zákaznickou základnu, tento přístup vám poskytne vizuální mapu toho, jak se vaše data vztahují, což vám umožní rozhodnout se, kde strom rozřezat , abyste získali perfektní počet shluků.
Základní logika hierarchického shlukování

Hierarchické shlukování ve svém jádru vytváří hierarchii skupin. Ta je často reprezentována dendrogramem , stromovým diagramem, kde svislá osa představuje vzdálenost nebo odlišnost mezi shluky. Čím nižší větev, tím podobnější jsou si položky. Tato metoda je neuvěřitelně flexibilní, protože vás nenutí předem definovat počet shluků (k) od samého začátku, na rozdíl od algoritmů jako K-Means.
AGNES: Přístup zdola nahoru

AGNES, neboli aglomerativní vnořování, je nejběžnější formou hierarchického shlukování. Začíná mentalitou „každý sám za sebe“, kde každý jednotlivý datový bod začíná jako svůj vlastní malý shluk . Odtud algoritmus iterativně slučuje dva nejbližší shluky, dokud není vše shluknuto do jedné obrovské skupiny.
Proces obecně probíhá v těchto krocích: nejprve se vypočítá matice blízkosti pomocí metriky vzdálenosti (jako je euklidovská vzdálenost). Poté se spojí dva nejpodobnější body. Matice se aktualizuje tak, aby odrážela tuto novou skupinu, a proces se opakuje. Aby to fungovalo, potřebujete kritérium propojení , abyste rozhodli, jak měřit vzdálenost mezi skupinami:
- Jednoduché propojení: Dívá se na minimální vzdálenost mezi libovolnými dvěma body v různých shlucích. To může vést k „řetězení“, kdy shluky rostou v dlouhých, tenkých liniích.
- Kompletní propojení: Zaměřuje se na maximální vzdálenost mezi body, s tendenci vytvářet kompaktnější, kulovitější skupiny.
- Průměrné propojení: Vypočítává průměrná vzdálenost mezi všemi dvojicemi bodů napříč dvěma shluky, čímž se zajistí vyvážený střední bod.
- Centroidní vazba: Měří vzdálenost mezi geometrické středy (centroidy) shluků, který je často odolnější vůči odlehlým hodnotám.
- Wardova metoda: Místo hrubé vzdálenosti se snaží o minimalizovat celkovou vnitroklastrovou varianci, čímž efektivně udržuje shluky těsné a soudržné.
DIANA: Strategie shora dolů

Na druhou stranu máme DIANA (Divizivní Analýza). Pokud se AGNES zabývá stavbou věže, DIANA se zabývá vytesáváním sochy . Začíná s jedním masivním shlukem obsahujícím každý jednotlivý datový bod a rekurzivně ho rozděluje na menší.
Algoritmus identifikuje shluk s největším průměrem (nejvíce odlišné body) a najde nejvíce „roztříštěné“ pozorování – to, které se nejvíce liší od ostatních. Toto pozorování zakládá novou skupinu a další body jsou přeřazeny na základě toho, ke které skupině jsou blíže . Toto pokračuje, dokud nejsou izolovány všechny body. Na rozdíl od AGNES stačí zvolit pouze metriku vzdálenosti; zde není vyžadována žádná metoda propojení.
Měření úspěchu a kvality
Protože v neřízeném učení neexistuje „správná“ odpověď, používáme specifické metriky, abychom zjistili, zda naše shluky skutečně dávají smysl. Obecně je dělíme na interní a externí validaci.
Interní validace nepotřebuje externí popisky. Například Davies-Bouldinův index se zaměřuje na poměr soudržnosti v rámci shluků k oddělení mezi shluky; nižší skóre je lepší. Potenciál napětí měří součet čtverců vzdáleností od centroidů, i když tento součet přirozeně klesá s přidáváním dalších shluků. Mezi další oblíbené nástroje patří metoda lokte a analýza siluety , které umožňují najít „ideální místo“ pro počet skupin.
Externí validace přichází na řadu, když máte k dispozici zlatý standard nebo expertní označení pro porovnání. Metriky jako Precision (přesnost), Recall (úplnost) a F-míra (F-míra) považují výsledek shlukování za klasifikační problém. Můžete také použít teorii informace , která využívá entropii a vzájemnou informaci k zjištění, o kolik se snižuje nejistota při porovnávání výstupu algoritmu se známými kategoriemi.
Reálné užitné technologie: Od financí k datové vědě
Nejde jen o akademickou teorii. Například ve financích je shlukování hnací silou diverzifikace portfolia . Použitím korelační matice výnosů aktiv jako míry vzdálenosti mohou investoři vytvořit dendrogram, aby viděli, které akcie se pohybují v souladu. Pro skutečnou diverzifikaci by se mělo vybírat aktiva z různých větví stromu, čímž se zajistí, že portfolio nebude příliš vystaveno jedinému rizikovému faktoru.
Kromě financí pomáhá shlukování i se segmentací trhu tím, že seskupuje zákazníky s podobnými nákupními zvyklostmi, což firmám umožňuje přizpůsobit si marketing. Klíčem je experimentovat s různými metrikami vzdálenosti – jako je Manhattan nebo Mahalanobis – a různými metodami propojení, aby se zjistilo, která z nich odhaluje nejpravděpodobnější vzorce v analyzovaném konkrétním souboru dat.
Zvládnutí těchto hierarchických technik umožňuje hluboké a strukturální pochopení dat a přechod od detailních analýz jednotlivých bodů k celkovému obrazu globálních kategorií. Vyvažováním aglomerativních a divizních strategií a ověřováním výsledků pomocí interních a externích metrik lze transformovat surový, neoznačený šum na akční a organizovanou inteligenci.

