Google 6. října vydal EmbeddingGemma 2 s otevřenými vahami pod Apache 2.0. Model převádí různé druhy obsahu do společného číselného prostoru pro hledání podobnosti. Plná varianta má 740 milionů parametrů; zvukovou a obrazovou část lze podle úkolu vynechat. Výstupem jsou reprezentace, nikoli hotové odpovědi.

Představme si zvukaře, který si pamatuje charakter ruchu, ale ne název souboru. Nebo rodinný archiv, kde hledáme krátký okamžik mezi stovkami záběrů. Pokud by vyhledávání obstálo na našich datech, mohlo by se z otázky stát několik konkrétních nalezených stop. Odpovědí by byl přehratelný podklad, ne nově vymyšlená scéna.

Důležitá je možnost zpracovávat obsah lokálně. Sama ale nezaručuje soukromí celé aplikace: záleží také na synchronizaci, protokolech, zálohách a službách kolem modelu. A podobný soubor není nutně správný soubor. U odborného či osobního archivu by proto měl uživatel vidět zdroj a rozhodnout, zda nalezený výsledek opravdu odpovídá.

Před nasazením bychom testovali vlastní české dotazy, tichou řeč i zaměnitelné záběry. Modelová karta upozorňuje na nestejnou kvalitu mezi jazyky a na ztrátu části kvality při silném zkrácení reprezentací. Je potřeba měřit nejen rychlost, ale také přehlédnuté položky, chybné shody, spotřebu a dobu prvního indexování.

Náš optimistický odhad je 2–4 týdny na malý lokální prototyp s omezeným archivem, má-li tým vhodné zařízení a zkušenost s integrací. Nejde o slib Googlu. Spolehlivá aplikace pro různé telefony a dlouhé záznamy bude potřebovat další ověřování; model sám hotový mediální archiv nenahrazuje.