ElectricShare.cz
Bezpečnost

Vaše AI vyhrála benchmark. Bez těchto údajů to mnoho neznamená

Vaše AI vyhrála benchmark. Bez těchto údajů to mnoho neznamená - Bezpečnost | SmartEnergyShare

Agent oznámí „hotovo“. Databáze ukazuje něco jiného. Model vyhraje benchmark, ale dostal víc pokusů než konkurence. A aplikace, která měla uspořádat dokumenty, žádá přístup k celému disku. Společný problém? Zaměňujeme přesvědčivý výstup za ověřitelný důkaz.

Britský AI Security Institute, zkráceně AISI, a koalice EvalEval chtějí tuhle mezeru zmenšit. Ke skóre přidávají podmínky, za kterých vzniklo. Pro každého, kdo pouští AI k firemním datům, je to podstatnější zpráva než další barevný žebříček.

Vaše AI vyhrála benchmark. Bez těchto údajů to mnoho neznamená

Dne 22. září 2026 EvalEval oznámila, že UK AISI využívá její infrastrukturu ke zveřejňování výsledků evaluací. Základem je společné schéma Every Eval Ever, zkráceně EEE, a platforma Evaluation Cards. Výsledek má dostat čitelný kontext a technický popis, podle kterého lze měření zkoumat a snáze opakovat.

Zveřejněná sada zahrnuje pět benchmarků hlavního experimentu: HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro a Terminal-Bench 2.0. Pokrývá šest modelů, od Claude Opus 4 po GPT-5.4. Přidává také dvě kyberbezpečnostní evaluace s částečně odlišnou sestavou modelů. Podrobnosti popisuje oznámení spolupráce AISI a EvalEval.

Podstatné je rozlišit tři věci. Zveřejněné skóre si můžete přečíst. Dobře zdokumentované skóre můžete přezkoumat. Reprodukovat výsledek znamená experiment skutečně zopakovat za odpovídajících podmínek. Ani pečlivě vyplněná karta sama nezaručuje, že bude dostupná původní verze komerčního modelu.

Představte si hypotetické srovnání dvou agentů opravujících program. První dostane jeden pokus a minutu. Druhý hodinu, opakované spuštění testů a informaci, zda už uspěl. Výsledné procento může být u obou spočítané správně. Přesto měří jinou situaci.

Pro bezpečnost je takový rozdíl zásadní. Potřebujete vědět, co model zvládne za běžného provozu, ale také kam se dostane s větším rozpočtem. Jedno číslo obě otázky nevyřeší.

Výpočetní rozpočet je součást výsledku

Výzkum AISI propojený se zveřejněnými daty zkoumá, jak výsledky ovlivňuje výpočet při samotném řešení úlohy. Autoři porovnávali až dvanáct modelů na sedmi benchmarcích. Měnili tokenový rozpočet, zkracování kontextu a opakované pokusy. Některé varianty dostávaly také minimální zpětnou vazbu o správnosti. Závěr: skóre závisí na protokolu testu. Studie AISI proto doporučuje srovnávat modely při odpovídajících rozpočtech a zveřejňovat průběh výkonu podle spotřebovaných prostředků.

Token přitom není univerzální jednotka výpočetní práce. Různé modely používají různé tokenizéry i architektury. Pro praktické rozhodování proto vedle tokenů sledujte čas, cenu a počet volání nástrojů.

Do vlastního záznamu experimentu bych zahrnul alespoň:

  • Přesnou verzi modelu, případnou kvantizaci a použitý adaptér.
  • Verzi datové sady, výběr úloh a identifikátor kódu.
  • Úplné zadání, systémové instrukce a dostupné nástroje.
  • Limity tokenů, času, pokusů a pravidla zpětné vazby.
  • Způsob hodnocení, neúspěšná spuštění a skutečné náklady.

EEE nabízí společný formát a převodníky například pro Inspect, HELM a lm-eval-harness. Podporuje také výsledky jednotlivých vzorků. Dokumentace projektu tak řeší praktický problém: výsledky nemusíte pokaždé dolovat z jiné tabulky.

Validní soubor ale ještě není pravdivý experiment. Chybné referenční odpovědi můžete naprosto vzorně uložit do JSON. Pořádek v datech pomáhá chyby odhalovat; sám je neodstraní.

Chcete ušetřit na energiích?

Zjistěte, kolik můžete ušetřit sdílením elektřiny z FVE nebo optimalizací bateriového úložiště.

Spočítat úsporu →

Vlastní test spustíte přes Inspect a Ollamu

Pro první pokus nepotřebujete výzkumný cluster. Inspect je otevřený evaluační nástroj vyvíjený UK AISI a Meridian Labs. Odděluje testovací data, postup řešení a hodnocení. Výsledky pak můžete procházet v rozhraní Inspect View. Základy popisuje dokumentace Inspect.

Následující ukázka předpokládá Linux nebo macOS, Python s podporou virtuálních prostředí a nainstalovanou, běžící Ollamu:

```bash python3 -m venv .venv source .venv/bin/activate python -m pip install inspect-ai openai ollama pull qwen3:8b ```

Balíček `openai` zde slouží jako klient kompatibilního rozhraní lokální Ollamy. Tento postup dokumentuje přímo přehled poskytovatelů pro Inspect.

Do souboru `zkouska.py` vložte jednoduchou kontrolu:

```python from inspect_ai import Task, task from inspect_ai.dataset import Sample from inspect_ai.scorer import match from inspect_ai.solver import generate

@task def kontrola(): return Task( dataset=[ Sample( input="Kolik je 17 krát 19? Odpověz pouze číslem.", target="323", ) ], solver=generate(), scorer=match(), ) ```

Pak spusťte test a prohlížeč záznamů:

```bash inspect eval zkouska.py --model ollama/qwen3:8b inspect view ```

Tohle je kontrola zapojení, nikoli důkaz kvality modelu. Jedna násobilka bezpečnost agenta opravdu neprověří. Dalším krokem má být sada skutečných úloh z vašeho provozu, včetně případů, kdy má systém odmítnout neoprávněnou akci.

Po prvním funkčním běhu uložte závislosti pomocí `python -m pip freeze > requirements.txt`. Zaznamenejte také verzi Ollamy a identifikátor staženého modelu. Samotný název modelu nemusí navždy označovat stejné soubory.

Při porovnávání neměňte současně zadání, model i hodnoticí pravidla. Když výsledek poskočí, potřebujete poznat proč. Jinak jste právě vyrobili další pěkný graf bez vysvětlení.

Kolik stojí ověřování a jaký počítač potřebujete

Varianta Qwen3 8B v knihovně Ollama má při kvantizaci Q4_K_M přibližně 5,2 GB. To je velikost balíčku, nikoli celková paměť potřebná za běhu. Připočtěte kontext, pracovní paměť a režii programu.

Pro malý lokální pilot dává smysl počítač se 16 GB RAM. Větší paměť poskytne rezervu, zejména při delších vstupech. Grafická karta může výpočet výrazně urychlit, ale konkrétní kapacitu vybírejte až podle změřeného zatížení. Osmimiliardový model s krátkým zadáním a stejný model nad dlouhým dokumentem mají odlišné nároky.

Cenu lze ukázat bez věštění aktuálního ceníku. Následuje čistě modelový výpočet: 200 úloh, každá s 5 000 vstupními a 2 000 výstupními tokeny. Celkem milion vstupních a 400 000 výstupních tokenů. Při hypotetické sazbě 25 Kč za milion vstupních a 100 Kč za milion výstupních vyjde jeden průchod na 65 Kč. Dvacet opakování stojí 1 300 Kč, bez dalších služeb a hodnocení.

Lokálně počítejte elektřinu i opotřebení techniky. Pokud celá sestava odebírá průměrně 200 W a běží deset hodin, spotřebuje 2 kWh. Při předpokládané ceně 6 Kč/kWh zaplatíte 12 Kč za energii. Vývojářův čas bývá dražší položka.

LoRA umožňuje přizpůsobovat model pomocí menší sady dodatečných parametrů. Pro reprodukovatelnost však ukládejte základní model i adaptér. Výsledek upravené varianty nelze automaticky připsat původním vahám. Otevřené modely z Hugging Face usnadňují kontrolu experimentu, nikoli bezplatný provoz.

„Hotovo“ musí potvrdit databáze. Oprávnění zase systém

ThinkingBox od Microsoftu představuje užitečný doplněk tohoto přístupu. Hodnotí konečný stav systému a vedlejší účinky agentových zásahů. Nestačí, že agent vytvořil přesvědčivou závěrečnou odpověď. Kontroluje se, co po něm skutečně zůstalo. Popis i materiály ke spuštění zveřejnili Microsoft a Hugging Face.

Ve vlastním systému můžete stejnou zásadu uplatnit jednoduše. Má agent změnit stav reklamace? Ověřte konkrétní záznam, historii změn i to, že neupravil cizí případ. Kontrolní skript by měl běžet mimo agentův dosah. Jinak si žák může přepsat známku do třídnice.

Rozlišujte také úspěch jednou a spolehlivost opakovaně. Model, který uspěje alespoň jednou z dvaceti pokusů, může být zajímavý pro výzkum schopností. Pro automatické zpracování plateb je takový údaj nedostatečný. Tam chcete znát četnost chyb a jejich následky.

Do stejného bezpečnostního obrazu zapadá Apple. Dne 2. října 2026 oznámil budoucí dodatečné kontroly pro udělování úplného přístupu k disku. Výslovně upozornil na rostoucí riziko autonomních agentů. Oznámení Applu však nepopisuje hotovou univerzální ochranu ani přesný termín nasazení.

Při testování proto zapisujte i oprávnění. Agent s přístupem k celému disku řeší jiný experiment než agent omezený na pracovní složku. Dobré skóre nikdy není důvod rozdávat širší přístup, než úloha potřebuje.

AstaBrief ukazuje, proč nestačí měřit jen rychlost

Ai2 dne 2. října 2026 otevřela AstaBrief 8B, model pro tvorbu vědeckých zpráv založený na Qwen3-8B. Bere výzkumnou otázku a nalezené úryvky literatury, ze kterých skládá text s citacemi. Zpřístupněné váhy a trénovací data umožňují podrobnější kontrolu a vlastní provoz.

Zajímavá jsou čísla za celý pracovní postup: režim Fast podle autorů průměrně potřebuje 51,1 sekundy na zprávu, režim Thinking 178,5 sekundy. To odpovídá přibližně 3,5násobnému zrychlení. Autoři zároveň upozorňují, že většina trénování a hodnocení proběhla v roce 2025. Výsledky tedy nejsou novým srovnáním se všemi nejlepšími modely října 2026. Viz představení AstaBrief od Ai2.

Pro vlastní test bych oddělil dobu vyhledávání, samotného generování a lidské kontroly. Zpráva hotová za minutu může potřebovat půlhodinu oprav. Stopky u posledního tokenu tenhle účet schovají.

Stejně pečlivě kontrolujte citace. Odkaz může existovat a přesto nepodporovat větu, ke které ho model připojil. Typickým problémem je rozšíření úzkého zjištění na obecné doporučení.

Praktická sada úloh proto má obsahovat také rozporné zdroje a otázky, na které dodané podklady nestačí. Hodnoťte, zda model přizná nedostatek důkazů. Plynulá odpověď za každou cenu není výhra.

U českého nasazení navíc přidejte české dokumenty. Úspěch na anglických vědeckých otázkách sám nedokazuje, že systém správně zpracuje místní technické názvosloví nebo firemní dokumentaci.

Z laboratoře k baterii: ověřujte skutečný účinek

V energetice má tahle debata velmi hmatatelný konec. Agent může správně vysvětlit princip bateriového úložiště a přesto chybně navrhnout jeho provoz. Nebo oznámit změnu nastavení, kterou řídicí systém vůbec nepřijal.

Pro modelový pilot nad firemní energetikou bych začal režimem pouze pro čtení. Vstupy mohou tvořit historická měření, cenová data a provozní omezení. Výstupem bude doporučení, které porovnáte s předem připraveným kontrolním výpočtem. Časové značky, jednotky a chybějící hodnoty patří mezi první testované chyby.

Praktický kontext nabízí energetická platforma SES, konkrétně témata [IoT monitoringu](https://smartenergyshare.com/iot-monitoring?utm_source=electricshare&utm_medium=referral&utm_campaign=satellite-marketing), [energetiky pro firmy](https://smartenergyshare.com/pro-firmy?utm_source=electricshare&utm_medium=referral&utm_campaign=satellite-marketing) a [obchodování flexibility](https://smartenergyshare.com/obchodovani-flexibility?utm_source=electricshare&utm_medium=referral&utm_campaign=satellite-marketing). Jde o příklady oblastí využití, nikoli tvrzení, že platforma používá popsané evaluační nástroje. Další tematické čtení nabízejí [ShareElectric.cz](https://shareelectric.cz) a [blog BESS Global](https://bess-global-blog.vercel.app).

Před každým opakováním obnovte stejný výchozí stav simulace. Jinak druhý agent může dostat jinak nabitou baterii a srovnání přestane platit. Zaznamenejte také omezení výkonu, dostupnost dat a pravidla zásahu člověka.

Začněte dvaceti skutečnými případy, které dobře znáte. Přidejte poruchové scénáře. Ukládejte všechny pokusy, včetně timeoutů a odmítnutých akcí. Teprve potom rozšiřujte autonomii.

Moje předpověď? Firemní zákazníci začnou ke skóre vyžadovat také záznam experimentu a cenu úspěšně dokončené úlohy. Dodavatel, který nabídne pouze procento z prezentace, bude mít problém. A zaslouženě.

Zdroje

Základem článku jsou primární materiály autorů nástrojů a výzkumu. Oznámení EvalEval dokládá rozsah spolupráce s AISI; samo nepředstavuje nezávislou reprodukci všech zveřejněných výsledků. Dokumentace Inspect slouží jako podklad praktické ukázky. Ta demonstruje sestavení testu, nikoli naměřený výkon zde popsaného počítače.

Český energetický kontext doplňuje OTE. Jeho údaje denního trhu mohou sloužit jako vstup do vlastního experimentu, ale nejsou konečnou maloobchodní cenou elektřiny. Pro širší vztah mezi AI, spotřebou energie a energetickými aplikacemi je relevantní analýza Mezinárodní energetické agentury.

Při opakování testů si kromě těchto odkazů archivujte konkrétní verze dokumentace, dat a programů. Webová stránka se může změnit stejně jako model dostupný přes rozhraní poskytovatele. Hypotetické ceny a příklady v článku slouží k vysvětlení výpočtu; nejde o nabídku konkrétní služby ani výsledky provedeného měření. Podklady k Applu, ThinkingBox a AstaBrief jsou odkazované přímo u příslušných tvrzení. Při citování jejich čísel zachovejte také uvedený rozsah experimentu, datum a omezení. Bez těchto informací by další sdílení znovu vytvářelo problém, který se celý obor snaží odstranit.

Obchodujete s batteriovými úložišti nebo hledáte partnera pro flexibilitu a day trading elektřiny? SmartEnergyShare nabízí kompletní řešení pro BESS projekty od 50 do 250 kW — obchodování flexibility, SVR služby a IoT monitoring. Zjistěte víc →

Další články na toto téma najdete na: Electric-Share.cz Co je SkyPilot a proč o něm mluví každý, kdo trénuje modely Vice o how uk