ElectricShare.cz
AI

AI přestává myslet nahlas. Co před vámi skrývá neprůhledná rekurence?

AI přestává myslet nahlas. Co před vámi skrývá neprůhledná rekurence? - AI | SmartEnergyShare

Model se zlepší o 31 procent. Skvělá zpráva, dokud nezjistíte, že pořád neprojde sedmi testy z deseti. Přesně takovou lekci nabízí experiment s malým jazykovým modelem na Hugging Face. Vedle něj rostou datová centra za miliardy dolarů a přibývají systémy, jejichž postup nelze jednoduše přečíst. Slovník umělé inteligence proto začíná připomínat návod ke smlouvě: neznámé pojmy vás mohou stát peníze.

AI přestává myslet nahlas. Co před vámi skrývá neprůhledná rekurence?

Výraz „opaque recurrence“ lze přeložit jako neprůhledná rekurence. Označuje opakované zpracování vnitřního stavu modelu ve formě, které člověk přímo nerozumí. Místo dalších vět dostáváme další výpočet nad číselnou reprezentací. Žádný tajný strojový jazyk s vlastní gramatikou k tomu není potřeba.

Pro srovnání: řetězec úvah, známý pod zkratkou CoT, rozepisuje mezikroky do textu. Rekurentní přístup může opakovaně použít výpočetní blok uvnitř sítě. Model tím získá prostor pokračovat ve zpracování, aniž každý krok převádí na slova.

Konkrétní příklad popsali Jonas Geiping a jeho spoluautoři. Jejich experimentální model měl 3,5 miliardy parametrů a opakováním vnitřního bloku dokázal využít více výpočtů při řešení úlohy. Více práce tedy nemusí znamenat více vygenerovaného textu. Podrobnosti uvádí výzkum rekurentní hloubky.

Příbuzný přístup Coconut vrací skrytý stav modelu zpět jako vstup místo jeho převodu na další slovo. Jde o konkrétní výzkumnou metodu, nikoli univerzální vlastnost všech chatbotů. Popisuje ji studie uvažování v latentním prostoru.

Praktický důsledek? Krátká odpověď nemusí být levná odpověď. A hezky napsané vysvětlení samo nedokazuje, že zachycuje skutečný postup výpočtu. Při výběru systému proto sledujte úspěšnost, dobu odezvy a cenu dokončené úlohy. Délka jeho monologu je dost mizerný účetní doklad.

Parametry, tokeny a LoRA: tři pojmy, které rozhodují o hardwaru

Parametry jsou naučené číselné hodnoty modelu. Tokeny jsou jednotky, na které systém rozděluje vstup a výstup. Jeden token nemusí být celé slovo. Český text se navíc může dělit jinak než anglický, takže převádět počet slov na účet za rozhraní pevným koeficientem bývá ošidné.

Označení 350M znamená přibližně 350 milionů parametrů. Při dvoubajtovém uložení každého parametru vycházejí samotné váhy na zhruba 700 MB. Model se sedmi miliardami parametrů potřebuje stejným výpočtem asi 14 GB. To jsou pouze váhy, nikoli kompletní paměťové nároky programu.

Kvantizace ukládá hodnoty s nižší přesností. Čtyřbitové váhy sedmimiliardového modelu mají teoretický základ kolem 3,5 GB. Připočtěte pomocná data, pracovní paměť a mezipaměť kontextu. Dlouhé dokumenty nebo více souběžných požadavků mohou původně pohodlnou rezervu rychle spolknout.

Dolaďování, označované jako fine-tuning, mění chování již natrénovaného modelu. LoRA při něm ponechá původní váhy zmrazené a učí menší doplňkové matice. Snižuje tím počet trénovaných parametrů a paměťové nároky. Princip vysvětluje původní práce o metodě LoRA.

LoRA ale nezaručuje, že libovolný trénink poběží na kancelářském notebooku. Záleží také na délce vstupů, velikosti dávky a použitém optimalizátoru.

Stejně pečlivě čtěte licence. Otevřené váhy automaticky neznamenají neomezené komerční použití. Například varianta Qwen2.5 se třemi miliardami parametrů používá zvláštní výzkumnou licenci. Uvádí ji přímo karta modelu v knihovně Ollama. Tlačítko ke stažení bohužel není právní stanovisko.

Chcete ušetřit na energiích?

Zjistěte, kolik můžete ušetřit sdílením elektřiny z FVE nebo optimalizací bateriového úložiště.

Spočítat úsporu →

Sto kroků GRPO: pěkné zlepšení, žádný zázračný zaměstnanec

Leonie Monigatti a spoluautoři zveřejnili 3. září 2026 postup dolaďování modelu LFM2.5-350M. Použili přibližně 500 vzorků, knihovnu TRL a 100 trénovacích kroků. Podle autorů je postup dimenzovaný i pro grafický akcelerátor dostupný v bezplatných prostředích Colab nebo Kaggle.

Ve vyhodnocení IFStruct vzrostlo skóre z 22,6 na 29,7 procenta. To je zvýšení o 7,1 procentního bodu, relativně přibližně o 31 procent. Pořád ovšem neprošlo 70,3 procenta testů. Výsledek se týká konkrétního benchmarku formátu a struktury, nikoli obecné inteligence nebo spolehlivosti při zpracování českých faktur. Postup i výsledky obsahuje návod na Hugging Face.

GRPO je metoda posilovaného učení. Pro stejné zadání vznikne skupina odpovědí, které dostanou odměny. Trénink posiluje odpovědi, jež si vedou lépe vzhledem k ostatním ve skupině. Nemusíte každou ručně známkovat: odměnu může vypočítat program. Implementaci popisuje dokumentace trénování GRPO v TRL.

Tady čeká past. Odměňujete pouze platný JSON? Model může vracet dokonale platné nesmysly. Kontrolujete jen přítomnost položky „částka“? Gratulujeme, právě jste vychovali účetního, který vyplní každé políčko a žádné číslo neověří.

Pro vlastní experiment nejdřív oddělte trénovací a testovací data. U faktur rozdělte také dodavatele a šablony, aby test nebyl převlečenou kopií tréninku. Měřte zvlášť syntaxi, shodu se schématem a správnost hodnot. Teprve potom porovnávejte původní model, lepší zadání a dolaďování. Jinak můžete týden optimalizovat problém, který vyřeší obyčejný validátor.

Vlastní pokus v Ollamě: JSON bez nákupu serveru

Strukturovaný výstup je odpověď určená pro další program. Typicky JSON s předepsanými položkami a datovými typy. Lokální Ollama umožňuje předat schéma přímo při generování. Je to podstatně pevnější zadání než zdvořilé „prosím, nepřidávej komentář“. Postup popisuje dokumentace strukturovaných výstupů.

Pro jednoduchou zkoušku po instalaci a spuštění Ollamy stáhněte menší model:

```bash ollama pull qwen2.5:1.5b ```

Jde o existující variantu v knihovně Ollama. Následující požadavek pošlete z terminálu. Názvy technických polí patří k rozhraní, zadání i vlastní datové položky jsou česky.

```bash curl http://localhost:11434/api/chat \ -H 'Content-Type: application/json' \ -d '{ "model": "qwen2.5:1.5b", "messages": [{ "role": "user", "content": "Z textu vytěž spotřebu a jednotku. Vrať objekt s položkami spotřeba a jednotka. Text: Dílna spotřebovala 18,4 kWh." }], "stream": false, "format": { "type": "object", "properties": { "spotřeba": {"type": "number"}, "jednotka": {"type": "string", "enum": ["kWh"]} }, "required": ["spotřeba", "jednotka"], "additionalProperties": false }, "options": {"temperature": 0} }' ```

Výsledný text hledejte v položce `message.content` obalové odpovědi. Očekávaným obsahem je objekt se spotřebou 18,4 a jednotkou kWh. V samotném JSON se desetinné číslo zapisuje tečkou.

Ani vynucené schéma neověřuje fyzikální význam. Model může zaměnit příkon za spotřebu nebo opsat jiné číslo. Další vrstva programu proto musí porovnat výsledek se vstupem a odmítnout neúplné údaje. Chybějící měření není nula.

Pro začátek použijte existující počítač, například s 16 GB operační paměti. Je to rozumná rezerva pro malý pokus, nikoli záruka konkrétní rychlosti. Tu změřte na svém procesoru. Ukládejte verzi modelu, nastavení a dobu každého požadavku. A připravte vedle snadného příkladu také zápornou hodnotu, chybějící jednotku a text se dvěma různými měřeními.

Paměť agenta: konečně si pamatuje, proč jste ten kód smazali

Kontextové okno představuje omezené množství informací, které model zpracovává v jednom požadavku. Trvalá paměť je jiná vrstva: uložené záznamy, z nichž aplikace později vybere relevantní části. Model kvůli tomu nemusí měnit své váhy.

S tím souvisí RAG, tedy generování doplněné vyhledáváním. Nejdřív se najdou podklady, potom z nich model sestaví odpověď. Základní princip kombinace modelu s externí znalostní databází popisuje původní výzkum RAG.

Konkrétní nástroj funes indexuje historii programovacích agentů. Vyhledané pasáže vrací s původem, například časem a konkrétní relací. Paměť drží lokálně v datové sadě Lance; volitelně ji lze sdílet přes vlastní datovou sadu na Hugging Face. Vzdálená varianta je podle autorů standardně soukromá. Podrobnosti přináší představení nástroje funes.

Po jeho instalaci lze připojit podporovaného agenta a položit otázku:

```bash funes add claude funes ask claude "Proč jsme změnili zpracování měření?" ```

Přínos je velmi konkrétní. Nová relace může dohledat, že jste předchozí řešení opustili kvůli časovým pásmům, nikoli kvůli rychlosti. Ušetří opakované pátrání i zbytečné přepisování.

Jenže archiv umí konzervovat také chyby. Stará domněnka se nesmí nenápadně proměnit v aktuální požadavek. Vyžadujte datum a zdroj rozhodnutí. Automatické hledání přístupových údajů před sdílením, které funes nabízí, berte jako pomocnou kontrolu. A rozlišujte místní indexování od následného použití nalezeného textu: pokud ho agent odešle vzdálenému modelu, data už místní prostředí opustila.

Datové centrum za 3,2 miliardy dolarů: neprůhledné mohou být i smlouvy

Areál Lake Mariner v americkém Somersetu ukazuje druhý druh neprůhlednosti. Podle reportáže Ars Technica má projekt hodnotu 3,2 miliardy dolarů. Vystupují v něm TeraWulf, Fluidstack, Google a mezi odběrateli výpočetní kapacity také Anthropic. Google má warranty umožňující budoucí získání čtrnáctiprocentního podílu a garantuje platby nájemného Fluidstacku. Reportáž řeší také požár rozestavěné budovy a odpovědnost za bezpečnost. Podrobnosti přináší Ars Technica.

S architekturou neuronové sítě to technicky nesouvisí. Pro zákazníka je ale otázka podobná: dokážete zjistit, kdo za kterou část služby odpovídá?

Při nákupu firemní AI si proto rozkreslete cestu dat. Kdo přijme dokument? Kdo provozuje model? Kde zůstávají protokoly? Kdo řeší výpadek? Logo na faktuře nemusí patřit provozovateli všech těchto vrstev.

Za nimi stojí fyzická infrastruktura. IEA ve zprávě z roku 2025 odhadla spotřebu všech datových center v roce 2024 na 415 TWh. Základní scénář pro rok 2030 počítá přibližně s 945 TWh. Nejde pouze o AI a nejde o jistou předpověď. Jde o scénář s výraznou nejistotou. Viz analýza energetické poptávky IEA.

Ve vlastní firmě začněte měřením serverovny. Pro tuto část projektu jsou relevantní IoT monitoring a nabídka energetických služeb pro firmy. Bez skutečného odběrového profilu těžko poznáte, zda se vyplatí přesouvat výpočty, měnit hardware nebo řešit chlazení.

Kolik vlastní AI skutečně stojí? Zásuvka řekne víc než prezentace

Předpokládejme malý počítač s průměrným příkonem 30 W, který běží nepřetržitě. Za třicet dní spotřebuje 21,6 kWh. Při modelové variabilní ceně 6 Kč/kWh zaplatíte přibližně 130 Kč měsíčně za elektřinu. Pevné platby, pořízení a správu tím nehradíte.

Pracovní stanice s průměrným příkonem 300 W spotřebuje za stejnou dobu 216 kWh. Ve stejném cenovém scénáři jde o 1 296 Kč. Tato čísla jsou výpočtové příklady, nikoli naměřené výsledky uvedených modelů.

Rozhoduje průměrný odběr celé sestavy. Příkon grafické karty z katalogu nestačí. Změřte klidový stav, běžnou práci i dávkové zpracování. K pořizovací ceně přidejte svůj čas: server potřebuje aktualizace, zálohy a občas člověka, který pochopí, proč v pondělí ráno neodpovídá.

Dávkové úlohy můžete plánovat podle ceny elektřiny. Podklady nabízí denní trh OTE, praktické vysvětlení také stránka spotových cen SmartEnergyShare. Velkoobchodní cenu ale nezaměňujte s konečnou cenou odběru podle vlastní smlouvy.

Pro návody k chytrému nakupování energie navazuje [ShareElectric.cz](https://share-electric.cz). Propojení měření a energetických služeb najdete přes řešení SmartEnergyShare. Energetická optimalizace však nenahradí kontrolu kvality modelu.

Začněte stovkou skutečných úloh. Změřte správnost, čas oprav a celkové náklady. Pak teprve přikupujte výkon nebo dolaďujte model. Můj tip: v běžných firmách často vyhraje malá AI s dobrými podklady a přísnou kontrolou. Ne proto, že má nejpůsobivější slovník, ale protože po ní nezůstává drahá hromada oprav.

Zdroje

  • Hugging Face: dolaďování malého modelu pomocí GRPO — Výchozí experiment pro uvedená skóre a rozsah trénování. Při opakování si poznamenejte verze knihoven i nastavení vyhodnocení. Výsledek na vlastních českých dokumentech měřte samostatně, bez automatického přebírání publikované úspěšnosti.
  • Hugging Face: vlastní paměť programovacích agentů — Primární popis nástroje funes, místního indexování a volitelného sdílení paměti. Pro firemní nasazení věnujte pozornost tomu, co ukládáte, kdo smí záznamy číst a které informace následně dostává použitý agent.
  • Výzkum rekurentní hloubky jazykových modelů — Technický podklad k opakovanému zpracování vnitřních reprezentací. Pomáhá oddělit konkrétní architektonickou metodu od obecného marketingového slibu, že model déle přemýšlí. Výsledky experimentální architektury nepřenášejte automaticky na jiné systémy.
  • IEA: energetická poptávka spojená s AI — Mezinárodní kontext spotřeby datových center. Při práci s čísly rozlišujte historický odhad, budoucí scénář a spotřebu konkrétního zařízení. Globální součet neposkytuje cenu ani energetickou náročnost vašeho jednotlivého požadavku.
  • OTE: výsledky denního trhu s elektřinou — Český primární zdroj tržních cen. Pro vlastní kalkulaci vždy zkontrolujte datum, časový interval a jednotky. Výsledný náklad sestavte podle svého způsobu účtování, včetně dalších příslušných položek ceny odběru.

Obchodujete s batteriovými úložišti nebo hledáte partnera pro flexibilitu a day trading elektřiny? SmartEnergyShare nabízí kompletní řešení pro BESS projekty od 50 do 250 kW — obchodování flexibility, SVR služby a IoT monitoring. Zjistěte víc →

Další články na toto téma najdete na: SmartEnergyShare.info Příklad výstupu EMO monitoring sidecar Vice o training and