Google přichází s modelem TabFM (Tabular Foundation Model), který slibuje zásadní zjednodušení práce s tabulkovými daty. Až doteď platilo, že pokud jste chtěli z firemních databází (např. pro predikci odchodu zákazníků nebo detekci podvodů) dostat spolehlivé výsledky, museli jste sáhnout po algoritmech typu XGBoost. To znamenalo hodiny a dny manuálního ladění parametrů (hyperparameter tuning) a přípravy datových rysů (feature engineering). TabFM naproti tomu využívá princip „in-context learning“, známý z velkých jazykových modelů. Trénoval se na stovkách milionů syntetických tabulek a dokáže analyzovat složité vztahy v datech takzvaně „zero-shot“ – tedy okamžitě, v jediném kroku a bez nutnosti model jakkoliv dotrénovávat pro konkrétní dataset. Google jej navíc brzy integruje přímo do svého datového skladu BigQuery, kde k pokročilé predikci postačí jednoduchý SQL příkaz.
Komentář:
Nápad aplikovat logiku, kterou známe z ChatGPT, na nudné excelové či databázové tabulky zní z pohledu běžného byznysu naprosto snově. Odstranění „černé magie“ spojené s laděním parametrů by mohlo otevřít pokročilou datovou analytiku i menším firmám, které si nemohou dovolit platit drahé týmy data scientistů. Má to ale jeden zásadní háček – TabFM je trénován čistě na syntetických, uměle vygenerovaných datech, protože sdílet reálná průmyslová data je kvůli citlivosti téměř nemožné. Otázkou tedy zůstává, jak si model poradí s „špinavými“ daty reálného světa – s chybějícími hodnotami, lidskými chybami při zadávání nebo s nestandardními formáty, se kterými si zkušení analytici u tradičních modelů musejí ručně poradit. Funkce „zadej SQL příkaz a dostaneš výsledek bez námahy“ zní skvěle pro management, ale reálně hrozí, že uživatelé bez hlubších znalostí strojového učení začnou dělat byznysová rozhodnutí na základě predikcí, u kterých vůbec nebudou tušit, jak k nim model dospěl.
Zdroj:
https://research.google/blog/introducing-tabfm-a-zero-shot-foundation-model-for-tabular-data
Napsat komentář