Co je LFM2.5-2.6B a proč to není další ChatGPT klon

Model o 2,6 miliardách parametrů se vejde do 3 GB RAM a odpovídá rychleji než ChatGPT přes web. Zní to jako marketingová věta, ale sedím u toho už týden — LFM2.5-2.6B od Liquid AI mi běží na starém Intel NUC vedle spotového monitoru cen elektřiny a nikam neposílá jediný bajt dat. Pro energetické poradenství, kde se točí citlivé odběrové diagramy a smlouvy klientů, je to rozdíl mezi "používáme AI" a "posíláme cizí firmě data o spotřebě celé vesnice".
Co je LFM2.5-2.6B a proč to není další ChatGPT klon
Liquid AI je startup vyrostlý z MIT, který místo klasické transformerové architektury staví na takzvaných Liquid Neural Networks — hybridní kombinaci konvolucí a rekurentních bloků. Výsledek: model se 2,6 miliardami parametrů, který na běžném CPU generuje 15-25 tokenů za sekundu, aniž by potřeboval GPU za 300 tisíc korun. Pro srovnání, GPT-4 třída modelů potřebuje datacentrum, LFM2.5 potřebuje notebook z roku 2019.
Model je dostupný přes Hugging Face pod licencí, která povoluje komerční nasazení do určitého ročního obratu firmy (nad 10 milionů dolarů ARR je nutná enterprise licence — pro drtivou většinu českých poradenských firem irelevantní). Kvantizované verze GGUF běží přímo v Ollamě: `ollama pull liquid/lfm2.5-2.6b` a za třicet vteřin máte lokální chat.
Rozdíl proti Mistralu 7B nebo Llama 3.2 3B je hlavně v latenci na slabém hardwaru. Liquid modely jsou stavěné primárně pro edge — tedy pro nasazení tam, kde není connectivity nebo kde connectivity nechcete kvůli GDPR.
Proč to řeším právě u energetického poradenství
V energetickém poradenství pracujeme denně s daty, která nechcete posílat do Kalifornie: odběrová místa klientů, spotřební profily, cenové kalkulace, interní marže. Když poradce potřebuje AI asistenta na rychlé vysvětlení tarifu nebo na sumarizaci faktury, cloudové API znamená, že text prochází přes servery OpenAI nebo Anthropicu, byť s DPA smlouvou.
Lokální model tohle obchází úplně. Na serveru, který stejně provozujeme pro monitoring spotových cen, si přidáte kontejner s LFM2.5 a máte interní asistenta, co umí:
- Vysvětlit klientovi rozdíl mezi fixní a spotovou sazbou
- Spočítat orientační úsporu ze sdílení elektřiny na základě jeho odběrového diagramu
- Vygenerovat draft e-mailu s aktuální spotovou cenou elektřiny pro klienty s dynamickým tarifem
Přesnost 2,6B modelu na komplexní energetické výpočty nestačí — na to potřebujete deterministický kód, ne LLM. Ale na rutinní komunikaci, sumarizaci a první draft odpovědi je to víc než dost, a hlavně to nestojí korunu za token.
Hardware a reálné náklady nasazení
Testoval jsem tři konfigurace. Raspberry Pi 5 s 8 GB RAM (cena kolem 2200 Kč) zvládne model v Q4 kvantizaci, ale s latencí kolem 8 tokenů/s — použitelné na dávkové zpracování, ne na chat v reálném čase. Mini PC s Intel N100 (typicky 4000-6000 Kč) už dá slušných 18 tokenů/s. A starší firemní NUC s i5 a 16 GB RAM, který stejně nikdo nepoužívá, zvládne i dvě instance paralelně.
Žádná z těchto sestav nepotřebuje GPU. To je klíčový bod — pokud jste si mysleli, že lokální AI znamená investici do RTX karty za 40 tisíc, u modelů téhle velikosti to neplatí. Provoz je navíc extrémně levný energeticky: N100 mini PC běžící 24/7 spotřebuje řádově 10-15 W, což je za rok pár stovek korun i při dnešních cenách elektřiny.
Pro srovnání s cloudem: pokud poradenská firma generuje řekněme 2000 AI dotazů měsíčně přes GPT-4o-mini API, zaplatí orientačně 300-600 Kč měsíčně podle délky promptů. Lokální řešení má nulové mezní náklady po pořízení hardwaru — návratnost do tří až šesti měsíců je běžná, pokud objem dotazů roste.
Instalace samotná je triviální:
```bash curl -fsSL https://ollama.com/install.sh | sh ollama pull liquid/lfm2.5-2.6b ollama run liquid/lfm2.5-2.6b "Vysvětli klientovi rozdíl mezi P a Q pásmem distribuce" ```
Pro produkční nasazení přidejte systemd službu a reverzní proxy s API klíčem, ať to není otevřené do internetu.
LoRA fine-tuning na energetická data — jak to reálně vypadá
Základní model neví nic o českém trhu s elektřinou, o OTE aukcích nebo o tom, co je SVR služba. Řešení je LoRA (Low-Rank Adaptation) — dotrénování malé vrstvy adaptérů na doménová data, aniž byste sahali na celý model.
Praktický postup, který jsme s kolegy zkoušeli na podobném projektu: nasbírat pár set párů otázka-odpověď z reálné poradenské praxe (anonymizované), použít knihovnu `peft` z Hugging Face a natrénovat adaptér na běžné GPU za pár hodin — klidně na pronajatém GPU z Vast.ai za pár desítek korun. Výsledný LoRA adaptér má řádově desítky megabajtů a našroubuje se na základní model za běhu.
Rozdíl v odpovědích je citelný. Neupravený model plácne obecnou odpověď o "výhodách zelené energie". Model s LoRA na energetická data z ČR umí rozlišit distribuční sazby, zmínit aktuální mechanismus obchodování flexibility nebo správně vysvětlit, jak funguje e-aukce dodavatele.
Riziko: LoRA na malém datasetu snadno overfituje. Pokud natrénujete na 200 příkladech, model se naučí odpovídat frázemi z trénovacích dat i tam, kde to nedává smysl. Doporučená hygiena — validační sada oddělená od trénovací, a hlídat perplexitu, ne jen "vypadá to dobře".
Otevřený model, otevřené riziko — na co si dát pozor
Ať se to řekne na rovinu: lokální model bez cloudové moderace nemá zábrany, jaké má komerční ChatGPT nebo Claude. LFM2.5 v základní verzi žádné hluboké content-filtry nemá zabudované přímo do vah, spoléhá se na system prompt a případný wrapper. To je pro firemní nasazení výhoda i riziko zároveň.
Výhoda: model neodmítá legitimní finanční kalkulace jen proto, že obsahují slovo "arbitráž" nebo "spekulace na spotovém trhu" — cloudové modely mají tendenci nad citlivějšími finančními tématy zbytečně moralizovat. Riziko: pokud model nasadíte do zákaznického rozhraní bez vlastního guardrailu, může vygenerovat nesmyslnou nebo zavádějící odpověď a nikdo to nezachytí.
Praktické doporučení z vlastní zkušenosti: nikdy nenasazovat lokální malý model přímo do klientského chatu bez lidské kontroly odpovědi, minimálně v prvních měsících. Používejte ho jako asistenta poradce — generuje draft, poradce ho odešle nebo upraví. Halucinace u 2,6B modelu jsou častější než u velkých cloudových modelů, zvlášť u konkrétních čísel a paragrafů zákona. Na čísla vždy napojte deterministický zdroj dat (databázi, API), model nechte jen formulovat text okolo.
Druhé riziko je bezpečnostní — pokud server s modelem vystavíte do internetu bez autentizace, někdo ho může zneužít jako výpočetní zdroj zdarma nebo si stáhnout interní prompty. Základní firewall a API klíč jsou minimum, ne bonus.
Kam s tím dál v energetickém poradenství
Reálný use case, který teď rozjíždíme: noční dávkové zpracování. Server stáhne aktuální spotové ceny, spočítá doporučení pro klienty s dynamickým tarifem, a LFM2.5 vygeneruje personalizovaný text notifikace — "zítra bude levná elektřina mezi 12. a 15. hodinou, doporučujeme nabít baterii". Žádný cloud, žádné API náklady, běží to na stroji, který má firma stejně zapnutý.
Pro firmy, co uvažují o podobném nasazení, dává smysl začít s energetickým poradenstvím a zjistit, kde přesně v procesu AI asistent ušetří nejvíc času — obvykle je to komunikace s klienty, ne samotné výpočty. Podrobnosti k fungování celého modelu sdílení a k tomu, jak zapadá AI podpora do procesu, najdete na stránce jak to funguje.
Podobnou cestou — malé modely na okraji sítě místo velkých cloudových — jde i vývoj chytrých sítí obecně. Víc k tématu smart grid a lokální AI v energetice najdete na smartenergyshare.info. Pokud vás zajímá i technická stránka VPP a optimizérů, kde se podobné edge modely nasazují pro řízení baterií v reálném čase, mrkněte na smartenergyshare.cz.
Předpověď na příští rok: modely kolem 2-3 miliard parametrů se stanou standardní součástí každého chytrého měřicího zařízení a domácí baterie. Ne proto, že by byly chytřejší než cloudové giganty, ale proto, že jsou zadarmo na provoz a nikam neposílají data o tom, kdy jste doma a kolik prádla peřete. To je v odvětví, které stojí na datech o spotřebě domácností, argument, který zváží víc než pár procent přesnosti navíc.
Zdroje
- oEnergetice.cz — vývoj cen elektřiny na spotovém trhu
- OTE — Operátor trhu s elektřinou
- Hugging Face — Liquid AI model repository
- ERÚ — Energetický regulační úřad
- PV Magazine — edge AI a decentralizovaná energetika
Obchodujete s batteriovými úložišti nebo hledáte partnera pro flexibilitu a day trading elektřiny? SmartEnergyShare nabízí kompletní řešení pro BESS projekty od 50 do 250 kW — obchodování flexibility, SVR služby a IoT monitoring. Zjistěte víc →
Další články na toto téma najdete na: SmartEnergyShare.info AI evals are becoming the new compute bottleneck Vice o olmo-eval: an