Probabl a tvůrci scikit-learn: proč budoucnost tabulární AI nestojí jen na generativních modelech

Konceptuální ilustrace budoucnosti tabulárního strojového učení, propojující tabulky, GPU výpočet a statistické algoritmy bez textu.

V debatě o umělé inteligenci dnes často dominují generativní modely, jejich výpočetní nároky a potřeba stále výkonnějších čipů. Yann Lechelle, spoluzakladatel společnosti Probabl, ale upozorňuje na jinou část oboru: statistické strojové učení nad tabulárními daty. Právě na něm stojí řada běžných úloh datové vědy a právě zde chce Probabl navázat na úspěch knihovny scikit-learn.

Plán společnosti má několik vzájemně propojených částí. Vybrané algoritmy scikit-learn chce zrychlovat pomocí GPU, aniž by se kvůli každé nové generaci hardwaru musel přepisovat celý softwarový základ. Vedle toho rozvíjí produkt Skore, který má spojit práci se scikit-learn a velkými modely pro tabulární data do jedné platformy. Partnerství s programem NVIDIA Inception má týmu pomoci nejen přístupem k odborníkům, ale také při promýšlení softwarové vrstvy mezi uživateli a výpočetní technikou.

Na tomto přístupu mě nejvíc zajímá jeho praktičnost. Probabl neslibuje, že každý problém vyřeší největším dostupným modelem. Ptá se, jak využít nástroje, na kterých už závisí rozsáhlá komunita, a připravit je na nové požadavky na výkon, náklady i automatizaci.

Obsah

📊 Tabulární data zůstávají důležitou součástí AI

Tabulární data jsou informace uspořádané do řádků a sloupců. Jeden řádek obvykle představuje záznam a sloupce popisují jeho vlastnosti. Pro práci s takovými daty se často používají postupy, které se liší od generování textu nebo obrázků. Mohou pomáhat hledat vztahy v datech, vytvářet předpovědi nebo rozdělovat záznamy do skupin.

To je důvod, proč Lechelle odděluje dvě diskuse, které se pod širokým označením AI snadno smísí. Generativní AI skutečně může vyžadovat značný výpočetní výkon. Probabl se však podle něj nejprve soustředí na statistické strojové učení. Nejde o popření významu generativních modelů, ale o volbu oblasti, ve které firma začíná a kde vidí prostor pro zlepšení zavedených pracovních postupů.

Rozdíl je důležitý i pro rozhodování o infrastruktuře. Pokud někdo potřebuje pracovat s tabulkou, nemá smysl automaticky předpokládat, že správnou odpovědí je co největší generativní model. Nejprve je potřeba vědět, jaký úkol data představují, jaké nástroje pro něj existují a kde výpočetní výkon skutečně pomůže. Z mého pohledu je právě tato zdrženlivost jedním z nejsilnějších bodů strategie Probabl.

Co v tomto kontextu znamená „tabulární AI“

Označení tabulární AI může znít jako nová kategorie, ale vychází z dobře známé práce s strukturovanými daty. Zahrnuje modely a postupy, které dokážou využít vlastnosti popsané ve sloupcích tabulky. V případě Probabl k tomu přibývá snaha nabídnout společné prostředí pro tradiční nástroje scikit-learn a velké modely určené pro tabulární data.

Podstatné je slovo společné. Pro uživatele nebývá největší překážkou pouze výkon jednoho algoritmu. Záleží také na tom, zda jednotlivé části práce tvoří srozumitelný celek. Pokud lze nástroje používat v návaznosti na dosavadní postupy, je snazší posuzovat, co přinášejí a kdy se jejich nasazení vyplatí. To je zatím směr, kterým se Probabl vydává, nikoli důkaz, že už vyřešil všechny problémy tabulární AI.

🧰 Proč je scikit-learn tak silným základem

Ambice Probabl se opírá o výjimečně rozšířený open source projekt. Knihovna scikit-learn vznikla v prostředí francouzského výzkumného institutu Inria a postupně se stala jedním ze základních nástrojů pro lidi, kteří začínají s datovou vědou nebo v ní pracují dlouhodobě. Poskytuje známé rozhraní pro řadu metod strojového učení a kolem tohoto rozhraní vyrostla široká komunita.

Lechelle uvádí více než pět miliard stažení scikit-learn a přibližně 1,3 milionu projektů na GitHubu, které na něm závisejí. Taková čísla dobře ilustrují jeho dosah. Zároveň je vhodné je číst přesně: počet stažení není počet jednotlivých lidí a závislost projektu sama o sobě neříká, jak intenzivně knihovnu používá. Pro strategii Probabl jsou však důležitá i s tímto omezením. Ukazují, že změny v tomto ekosystému mohou mít značný dopad.

Rozšířený open source nástroj má jednu výhodu, kterou nelze snadno získat pouhým uvedením nové platformy: lidé jej už znají. Mají kolem něj vytvořené postupy, sdílejí zkušenosti a při řešení potíží mohou vycházet z práce komunity. Probabl proto nemusí začínat otázkou, jak všechny přesvědčit, aby opustili dosavadní svět. Zajímavější otázka zní, jak tento svět rozšířit o nové možnosti.

Otevřený ekosystém jako výhoda i závazek

Podle Lechelle používají softwaroví inženýři, datoví inženýři i datoví vědci open source každý den. Otevřená komunita se dokáže věnovat mnoha různým problémům současně. Právě tato rozmanitost přispívá k tomu, že nástroje jako scikit-learn zůstávají užitečné napříč projekty.

Pro firmu, která na takovém základu staví, z toho ale plyne i závazek. Nestačí přidat technologii a předpokládat, že si k ní uživatelé najdou cestu. Je třeba promyslet, jak nabídnout podporu skutečným pracovním postupům, aniž by se ztratila dostupnost a srozumitelnost původního nástroje. Lechelle tuto výzvu formuluje jako hledání způsobu, jak nasměrovat sílu open source ekosystému k použitelným obchodním scénářům.

Já v tom vidím zásadní rozdíl mezi technickou novinkou a produktem. Technická novinka ukazuje, že něco lze udělat. Produkt musí navíc pomáhat lidem dělat to opakovaně, přehledně a s rozumnými náklady. Úspěch scikit-learn dává Probabl silný výchozí bod, ale také nastavuje vysoká očekávání.

⚡ Kdy má smysl přesunout výpočty z CPU na GPU

Scikit-learn byl původně navržen především pro využití procesorů CPU. To odpovídá jeho historii i tomu, jak se knihovna rozšířila mezi uživateli. Probabl nyní zkoumá, u kterých algoritmů je výhodnější přesunout výpočty na grafické procesory GPU. Lechelle výslovně mluví o vybraných algoritmech a estimátorech, nikoli o plošném tvrzení, že GPU má nahradit CPU při každé úloze.

Estimátor je v terminologii scikit-learn objekt, který se učí z dat nebo nad nimi provádí určitý výpočet. Přesun jeho práce na GPU může být zajímavý tam, kde povaha výpočtu a jeho rozsah takový krok ospravedlňují. Samotná existence GPU však ještě neznamená, že bude každá úloha automaticky rychlejší nebo levnější.

Tohle rozlišení považuji za důležité. Při rozhodování o akceleraci nejde jen o otázku, zda je jeden čip v určitém měření rychlejší než druhý. Smysl má uvažovat o celé úloze: jak často se spouští, jak velká data zpracovává, jak zapadá do ostatních kroků a kolik úsilí vyžaduje změna prostředí. Právě proto Probabl zdůrazňuje selektivní přístup. Cílem je zrychlit vhodné části, ne vytvářet další složitost tam, kde nepomáhá.

Výkon bez přepisování všeho od začátku

Hardwarová akcelerace bývá lákavá, dokud nevyžaduje neustálé úpravy softwaru pro každou novou generaci čipů. Probabl proto klade důraz na abstrakční vrstvu. V popisu svého přístupu zmiňuje zejména Array API, tedy společné rozhraní pro práci s poli napříč kompatibilními nástroji. Jeho širší technické pozadí popisuje specifikace Array API.

Myšlenka je srozumitelná i bez znalosti detailů implementace. Software na vyšší úrovni by se měl co nejméně vázat na zvláštnosti jediného zařízení. Pokud je mezi algoritmem a konkrétním hardwarem vhodně navržené rozhraní, mohou se nové možnosti hardwaru do pracovních postupů zapojovat snáze. To neznamená, že kompatibilita nebo výkon vzniknou samy od sebe. Znamená to, že tým nemusí pokaždé znovu řešit celý problém od prvního řádku.

Lechelle spojuje tento přístup se škálováním úloh v čase. Nové generace čipů mají přicházet do prostředí, jehož základní uspořádání už s takovou změnou počítá. Pro uživatele by ideální výsledek vypadal jednoduše: mohl by dál pracovat s dobře známými nástroji, zatímco vhodné výpočty by využívaly dostupnější nebo výkonnější zázemí. Mezi touto představou a jejím naplněním je samozřejmě technická práce. Důležitý je ale směr, který nepožaduje, aby každý uživatel přemýšlel jako odborník na hardware.

🧩 Skore má spojit známé postupy s novými modely

Vedle akcelerace jednotlivých částí scikit-learn představuje Probabl produkt Skore. Jeho zamýšlenou rolí je sjednotit práci se scikit-learn a velkými modely pro tabulární data do jedné platformy pro strojové učení. Jde o další krok oproti pouhému zrychlení výpočtů: pozornost se přesouvá k tomu, jak lidé různé možnosti používají společně.

Pro pochopení této ambice pomáhá rozlišit knihovnu a platformu. Knihovna nabízí stavební prvky, které lze zahrnout do vlastního projektu. Platforma se snaží tyto prvky zasadit do širšího pracovního rámce. Probabl tak staví na známém nástroji, ale chce kolem něj vytvořit soudržnější vrstvu pro práci s tabulární AI.

Z dostupného představení Skore neplyne podrobný seznam funkcí ani tvrzení, že jedna metoda vždy překoná jinou. Nebylo by proto přesné mu takové vlastnosti připisovat. Podstatná informace je strategická: Probabl nechce stavět svět tradičního strojového učení proti novějším modelům pro tabulární data. Chce, aby se s nimi dalo pracovat v jednom prostředí.

Já tento krok vnímám jako pokračování stejné myšlenky, která stojí za GPU akcelerací. Uživatel by neměl být nucen řešit každou technologickou změnu jako úplně nový začátek. Pokud už zná scikit-learn, má smysl na této znalosti stavět. Pokud se objeví jiný model vhodný pro určitou tabulární úlohu, měla by existovat cesta, jak jej posoudit v rámci širší práce s daty.

Pětiletá ambice a její skutečný význam

Lechelle říká, že Probabl se chce během pěti let stát přední světovou společností v oblasti tabulární AI. Je to cíl firmy, nikoli hotový stav nebo zaručený výsledek. Zajímavé však je, jak si firma tuto pozici představuje: ne jako jediný izolovaný model, ale jako spojení open source základu, výpočetní akcelerace, produktové vrstvy a dostupnosti pro uživatele.

Taková ambice také ukazuje, že tabulární data Probabl nepovažuje za okrajovou disciplínu. V době, kdy se pozornost často soustředí na generování obsahu, sází společnost na oblast, ve které se práce s daty již pevně zabydlela. Její sázka spočívá v tom, že i zavedené postupy mohou získat novou hodnotu, pokud se podaří odstranit technické překážky a zpřístupnit další možnosti.

🤝 Co má přinést partnerství s NVIDIA Inception

Probabl spolupracuje s programem NVIDIA Inception, který je zaměřen na podporu startupů v oblasti technologií a AI. Lechelle zdůrazňuje, že význam této spolupráce nespočívá pouze ve výpočetním výkonu. Pro jeho tým je důležitý také vztah s NVIDIA a přístup k jejím odborníkům, se kterými může probírat konkrétní technické otázky.

To odpovídá povaze problému, který chce Probabl řešit. Vytvořit užitečnou vrstvu mezi scikit-learn, dalšími modely a měnícím se hardwarem není jen otázka pořízení rychlejšího čipu. Vyžaduje rozhodnutí o kompatibilitě, rozhraních a tom, jak se mají technologie chovat při skutečném použití. Rozhovor s lidmi, kteří znají hardwarové a softwarové možnosti GPU, může být pro takovou práci cenný.

Spolupráci ale není důvod popisovat jako hotové univerzální řešení. To, že Probabl a NVIDIA pracují na akceleraci a vhodné abstrakční vrstvě, samo o sobě neříká, že všechny algoritmy scikit-learn poběží na GPU nebo že přechod mezi zařízeními bude za všech okolností bez práce. Přesnější je říci, že partnerství podporuje cestu k prostředí, v němž by uživatelé mohli lépe využívat nové generace hardwaru.

Neviditelná složitost je také hodnota

Lechelle popisuje zamýšlený výsledek jako vrstvu, která bude pro koncové uživatele co nejplynulejší. Právě to je často nejméně nápadná, ale nejdůležitější část technického pokroku. Uživatel nemusí znát každý detail cesty od dat přes algoritmus až k čipu. Potřebuje však vědět, že jeho postup dává smysl a že změna infrastruktury nevyžaduje úplnou změnu způsobu práce.

Abstrakce přitom není totéž co skrytí všech rozdílů. Některé úlohy zůstanou vhodnější pro CPU, jiné mohou těžit z GPU. Dobrá softwarová vrstva by měla pomáhat tyto možnosti využít, ne zakrývat jejich omezení. To je také důvod, proč považuji formulaci „vybrané algoritmy“ za důležitější než obecný příslib akcelerace strojového učení.

🌱 Open source musí dávat smysl i v praxi

Scikit-learn vyrostl díky otevřenému vývoji a širokému používání. Probabl nyní hledá způsob, jak na této síle stavět také ve firemním prostředí. Lechelle upozorňuje, že open source komunita řeší velké množství problémů, protože se na ní podílí mnoho lidí s různými potřebami. Klíčová otázka pro Probabl zní, jak z tohoto dění vytvořit řešení, která pomohou konkrétnímu použití.

Takový úkol nelze zúžit na výkon. Uživatel potřebuje také předvídatelné postupy, přístup k potřebným schopnostem a rozumný vztah mezi přínosem a náklady. Jestliže se nový nástroj obtížně začleňuje do zavedené práce, jeho technické přednosti se mohou ztratit v provozních komplikacích. Naopak dobře navržená návaznost na existující ekosystém může usnadnit přijetí i bez toho, aby se každý musel učit zcela nové základy.

To je širší význam spojení scikit-learn, Skore a hardwarové akcelerace. Každá část odpovídá na trochu jinou otázku:

  • Scikit-learn: Jak navázat na nástroj, kterému už komunita rozumí?
  • GPU akcelerace: Kde může nový hardware zlepšit práci vybraných algoritmů?
  • Array API a abstrakční vrstva: Jak omezit závislost vyššího softwaru na jedné generaci čipů?
  • Skore: Jak nabídnout společné prostředí pro zavedené postupy a další modely pro tabulární data?

Jeden seznam samozřejmě neřeší všechny technické otázky. Pomáhá však pochopit, proč Probabl mluví o celé vrstvě pro tabulární AI, nikoli jen o rychlejší verzi jedné knihovny.

🔋 Výkon se musí posuzovat společně s náklady a energií

V rozhovoru o budoucnosti AI zaznívá také potřeba sledovat celkové náklady na vlastnictví, často označované zkratkou TCO. Jde o širší pohled než na samotnou cenu čipu nebo rychlost jedné operace. Pro smysluplné nasazení je důležité, jaké zdroje řešení spotřebuje během používání a jaký užitek za ně poskytne.

Lechelle tuto úvahu spojuje s obrazným měřítkem „inteligence na gigawatt“. Mluví o maximalizaci počtu tokenů, tedy jednotek zpracovávaného obsahu, na jednotku dostupného výkonu či energie, a přeneseně o množství užitečné inteligence, které lze z energetických zdrojů získat. Není to představení hotové metriky pro porovnání všech metod strojového učení. Je to způsob, jak připomenout, že výpočetní kapacita není neomezená a měla by přinášet co největší hodnotu.

U tabulární AI z toho podle mě plyne velmi praktická otázka: je pro konkrétní úlohu zvolený postup přiměřený? Pokud může známá metoda splnit zadání s rozumnými náklady, není nutné ji nahrazovat jen proto, že je k dispozici novější typ modelu. Pokud naopak vhodná akcelerace umožní lépe zpracovat náročnou úlohu, stojí za zvážení. Smyslem není prosazovat jeden druh hardwaru nebo modelu za každou cenu, ale používat je tam, kde přinášejí skutečný užitek.

Proč nestačí měřit jen rychlost

Rychlost je snadno pochopitelná a často také důležitá. Sama o sobě však nezachytí cenu úprav, správu prostředí ani návaznost na další práci. Výpočet, který je na novém zařízení rychlejší, může být pro tým méně zajímavý, pokud kvůli němu musí složitě měnit zavedené postupy. Právě zde se propojuje ekonomický pohled s technickým rozhodnutím o abstrakční vrstvě.

Probabl se snaží obě hlediska spojit: zpřístupnit výkon tam, kde pomůže, a současně omezit náklady na změny. Zda se tento záměr podaří naplnit v konkrétních úlohách, bude záležet na implementaci a zkušenosti uživatelů. Jako rámec pro vývoj je ale srozumitelný. Neptá se pouze, co lze zrychlit, nýbrž také za jakou cenu a pro koho.

🤖 Novými uživateli nástrojů jsou také agenti

Jedno z nejpozoruhodnějších tvrzení se netýká čipů, ale toho, kdo dnes software využívá. Lechelle uvádí, že scikit-learn zaznamenal během posledních 12 měsíců přibližně dvě miliardy stažení a že většina z nich podle něj souvisí s agenty. V této souvislosti má na mysli automatizované systémy, které pracují s nástroji a jejich dokumentací strojovým tempem.

Takové tvrzení si zaslouží opatrné čtení. Stažení balíčku nelze jednoduše převést na počet agentů, lidí ani dokončených datových projektů. Automatizované instalace a opakované používání mohou vytvářet velké objemy stažení. Lechelleho sdělení je přesto významné: při navrhování softwaru už nelze počítat pouze s člověkem, který si ručně pročte dokumentaci a krok za krokem sestaví vlastní postup.

Pokud s nástroji pracují také agenti, roste význam jasně popsaných rozhraní a předvídatelného chování. To je moje interpretace širšího důsledku tohoto vývoje, nikoli tvrzení, že agenti již zvládají každou úlohu samostatně. Software používaný automatizovanými systémy musí být stejně pečlivě navržený jako software určený lidem. Čím více se práce urychluje, tím méně prostoru zbývá pro nejasnosti, které by jinak člověk při ruční práci průběžně vyřešil.

Jedna vrstva pro lidi i automatizované systémy

Probabl chce vytvořit prostředí, které bude přístupné koncovým uživatelům bez ohledu na to, zda s ním přímo pracuje člověk, nebo jej využívá agent. Tady se znovu setkávají hlavní motivy celé strategie: otevřený ekosystém, společné rozhraní a snaha odstínit zbytečnou technickou složitost.

Pro člověka může dobře navržená vrstva znamenat méně rozhodování o detailech infrastruktury. Pro automatizovaný systém může znamenat konzistentnější způsob, jak dostupné nástroje použít. Ani v jednom případě to nenahrazuje potřebu ověřovat výsledky a rozumět omezením zvoleného postupu. Ukazuje to však, proč je rozhraní stejně důležité jako samotný výpočetní výkon.

🔭 Co si z přístupu Probabl odnést

Probabl spojuje několik trendů, které se snadno posuzují odděleně. Scikit-learn představuje mimořádně rozšířený základ statistického strojového učení. GPU nabízí možnost urychlit vybrané výpočty. Array API má pomoci oddělit vyšší softwarovou vrstvu od konkrétního hardwaru. Skore má propojit zavedené nástroje s velkými modely pro tabulární data. A rostoucí role agentů mění představu o tom, kdo s těmito nástroji pracuje.

Žádný z těchto bodů sám o sobě neznamená, že budoucnost tabulární AI je rozhodnutá. Probabl představuje ambici a směr vývoje, nikoli hotovou odpověď na každou datovou úlohu. Jeho přístup ale nabízí užitečné měřítko: nové možnosti mají největší cenu tehdy, když navazují na fungující ekosystém, zjednodušují práci a zlepšují poměr mezi výsledkem a spotřebovanými zdroji.

Právě proto bych příběh Probabl nečetl jako další souboj generativní a tradiční AI. Zajímavější je otázka, jak dát dlouhodobě používaným metodám prostor na moderním hardwaru a vedle novějších modelů. Pokud se to podaří bez zbytečného přepisování a s ohledem na náklady, může tabulární strojové učení zůstat nejen důležitou součástí datové vědy, ale také přístupnější součástí její další etapy.

Share this post

AI World Vision

AI and Technology News