Všechny projekty

Palisade

Obrana agentů proti prompt injection: evaluační rig, red-team aréna a živý filtr před voláním nástrojů.

Ve vývoji

Evaluační rig měří to, na čem záleží u agenta, ne u chatbota: jak často útok unese volání nástroje a jak často změní postoj modelu, proti serveru s falešnými nástroji a sandboxovaným stavem izolovaným per session, takže nic nepřátelského nikdy nemá skutečný vedlejší účinek. Aréna hraje červený tým proti modrému v self-play, se sebezpevňující personou, která přepisuje vlastní prompt, dokud úspěšnost útoků nezkolabuje.

Prvním nasazeným konzumentem je živá obrana uvnitř sessions kódovacích agentů: hooky prověřují příchozí obsah, označují prohřešky per session a zavírají bránu, dokud je člověk nezkontroluje. Každý vstup se skóruje deterministicky; model může podezření zvýšit, ale nikdy ho zrušit. Znovupoužitelná knihovna, HTTP brána a MCP balíček jsou navržené a zatím nepostavené.

palisade.galvani.pro

Python, MCP, Claude Code hooks