Prompt injection detection benchmark 2026: AgentID vs Llama Prompt Guard
Benchmark porovnává detection capability, false positives, latency, metodiku a limity na veřejných datasetech.
Autor: Redakce AgentID • 6 min čtení.
20. září 2026
Co benchmark měří
Prompt injection benchmark testuje, zda control rozpozná útočný nebo manipulační vstup. Vyšší recall snižuje šanci, že útok projde, ale sám o sobě nevypovídá o dopadu v produkci.
Výsledek ovlivňuje dataset, prompt format, threshold, modelová verze a způsob vyhodnocení. Při srovnání vždy čtěte metodiku i limity.
Co navíc potřebuje production
V reálném workflow je nutné pracovat s user identity, nástroji, retrieved contextem, oprávněním a akcí, kterou agent může provést. Stejný detekovaný pattern může vyžadovat warn, block nebo human review.
Nízká latency je důležitá tam, kde kontrola běží inline. False positives naopak rozhodují o tom, zda budou týmy policy obcházet.
Jak testovat vlastní use case
Připravte reprezentativní benigní i adversarial prompty, testujte po změně policy a zapojte vlastníky workflow. Zaznamenejte verdict, policy version a výslednou akci.
AgentID poskytuje runtime controls a evidence pro vyhodnocení konkrétního deploymentu; benchmark nenahrazuje vlastní validation.