Google představil svůj nový špičkový model Gemini Omni, který označuje jako tzv. world model (model světa). Tento systém přináší pokročilá multimodální kouzla, kdy dokáže v reálném čase plynule propojovat a chápat text, obraz, zvuk i video, čímž se schopnosti umělé inteligence opět posouvají blíž k přirozenému lidskému vnímání. Více informací najdete přímo na DeepMind.
Zdroj: https://deepmind.google/models/gemini-omni
Komentář
Označení world model není jen marketingový tahák. Pokud AI dokáže skutečně vnímat časoprostorové souvislosti z videa a zvuku naráz, a ne jen pasivně překládat obrázky na text, mění to pravidla hry. Pro Google je to kritický krok, jak si udržet technologický náskok a ukázat, že multimodální budoucnost nestojí jen na generování hezkých textů, ale na hlubokém pochopení kontextu světa kolem nás. Teď už jen zbývá počkat, jak rychle se tyto sliby propíší do reálných produktů a stabilního API bez drastického nárůstu latence.