Mi fér bele 90 napba, és mi nem?
Kilencven nap alatt egy 50–200 fős cégnél egyetlen, szűken körülhatárolt folyamatra lehet éles AI ügynököt indítani, emberi jóváhagyással minden visszafordíthatatlan lépés előtt. Ami nem fér bele: három folyamat párhuzamosan, a teljes autonómia, az ERP kiváltása, és minden olyan eset, ahol az adat ma papíron vagy a kollégák fejében van.
| Belefér 90 napba | Nem fér bele |
|---|---|
| Egy folyamat, egy csapat, 5–20 felhasználó | Cégszintű bevezetés több osztályon |
| Emberi jóváhagyás mellett futó ügynök | Felügyelet nélküli, autonóm működés |
| Két-három meglévő rendszer olvasása, egybe írás | Rendszercsere vagy adatmigráció |
| Meglévő, gépi úton elérhető adat használata | Papíralapú archívum digitalizálása |
| Mért pilot és döntés a folytatásról | Bizonyított éves megtérülés |
A 90 nap nem varázsszám. Azért ennyi, mert egy negyedév a leghosszabb időtáv, amit egy cégvezető úgy tud finanszírozni, hogy közben nem kell félidőben megvédenie a projektet a pénzügy előtt. Ha a terv 9 hónapra szól, az első átszervezés vagy az első rossz negyedév megeszi.
Az „éles” itt azt jelenti, hogy a rendszert valódi munkanapon, valódi adaton, valódi felhasználók használják, és van mögötte visszaállási terv. Nem demót jelent, és nem is egy bemutatót a vezetőségnek.
A csapat kicsi. Egy döntéshozó, aki a hatókört védi, egy folyamatgazda, aki tényleg ismeri a kivételeket, egy fejlesztő és egy jóváhagyó a szakterületről. Négy ember heti pár órája. Ha ennél nagyobb a bizottság, a 90 napból három hét megy el egyeztetésre, és a hatókör az első hónapban duplájára nő. Azt láttuk, hogy a folyamatgazda hiánya a leggyakoribb csúszási ok, nem a fejlesztői kapacitás.
Miért hal el a legtöbb vállalati AI pilot?
Három visszatérő ok van. Nincs előre rögzített, számokban kifejezett siker-kritérium. A rendszer azon a munkafolyamaton kívül fut, ahol a munka valójában zajlik, ezért senki nem használja. És a költség futás közben nem látszik, csak a havi számlán. Egyik sem technológiai probléma.
95%
a vállalati generatív AI pilotoknak nem hozott mérhető P&L-hatást
MIT Project NANDA, 2025. július
40%+
az agentic AI projektekből 2027 végéig leállításra kerül a Gartner előrejelzése szerint
Gartner, 2025-06-25
67% vs 22%
sikerráta belső szakértő + külső partner, illetve csak belső IT esetén
MIT Project NANDA, 2025. július
A 95%-os szám a MIT Project NANDA 2025 nyári felméréséből származik, amely 300-nál több bejelentett vállalati bevezetést, 52 interjút és 153 vezetői kérdőívet dolgozott fel. A kutatás következtetése az volt, hogy a modellek nem gyengék, a bevezetés menedzselése rossz. Ez 2025-ös adat, így kell datálni is.
1. Nincs előre rögzített siker-kritérium
A legtöbb pilot azzal indul, hogy „nézzük meg, mire jó”. Ebből az következik, hogy a végén nincs mihez hasonlítani. Írd le a nulladik héten, egyetlen mondatban: mennyi ma az átfutási idő, mennyi a hibaarány, és mekkora javulás mellett folytatod. Ha ezt nem tudod leírni, a pilot nem indulhat el. A számokhoz jó belépő az AI megtérülés-kalkulátorunk, ahol a payback hónapja és a hároméves nettó haszon is kijön.
2. Az ügynök a munkafolyamaton kívül van
Ha a kolléga csak úgy fér hozzá, hogy megnyit egy külön felületet, bemásol egy szöveget, és kimásolja az eredményt, akkor a harmadik héten már nem használja. Az ügynöknek abban a rendszerben kell megjelennie, ahol az ember amúgy is dolgozik: az ERP jóváhagyási képernyőjén, a ticketben, a levelezésben. Ez integrációs munka, nem modellválasztás. Az ütemezéséről az AI integráció meglévő rendszerekbe cikkünkben van részletes 4–12 hetes bontás.
3. A költség futás közben nem látszik
A TechCrunch 2026. június 5-i riportja szerint az Uber áprilisra elfogyasztotta a teljes 2026-os AI-kódolási büdzséjét, a FinOps Foundation ügyvezetője pedig arról számolt be, hogy cégek tavasszal háromszorosan lépték túl az egész évre tervezett token-keretüket. Egy 50–200 fős cégnél ez nem milliárdos tétel, de a projekt hitelét ugyanúgy elviszi. A védekezés nem a havi költségplafon, mert az utólag lép. Futásonkénti kemény korlát kell, plusz lépésszám-limit.
1–2. hét: melyik folyamattal kezdj?
Az első két hét egyetlen döntésről szól: melyik folyamat lesz a pilot. Öt szempont alapján pontozd a jelölteket, egyenként 1, 3 vagy 5 ponttal. A volumen, a szabályozottság, a hibaköltség, az adat elérhetősége és a mérhetőség együtt megmondja, melyik folyamaton térül meg a munka és melyiken nem.
| Szempont | 1 pont | 3 pont | 5 pont |
|---|---|---|---|
| Volumen | havi 50 eset alatt | havi 50–500 eset | havi 500 eset felett |
| Szabályozottság | minden eset egyedi mérlegelés | van írott szabály, sok kivétellel | írott, betartott szabály, kevés kivétel |
| Hibaköltség | egy hiba jogi vagy pénzügyi kár | egy hiba fél nap javítás | egy hiba percek alatt javítható |
| Adat elérhetősége | papír, fejek, e-mail-mellékletek | rendszerben van, de az export nehézkes | API-n vagy adatbázisból kiolvasható |
| Mérhetőség | senki nem tudja, ma mennyi idő | van becslés, mérés nincs | van mért átfutási idő és hibaarány |
A 21 pont feletti folyamattal kezdj. A 13 és 20 közöttiek a második körbe valók, mert ott előbb az adaton vagy a szabályokon kell dolgozni. A 12 pont alattiakhoz ne nyúlj AI-jal, mert ott nem az automatizálás hiányzik, hanem a folyamat. Use case-ötletekhez a vállalati MI útmutatónk katalógusa ad kiindulást.
Nálunk ebben a fázisban a leggyakoribb tanács az, hogy ne ügynököt építsünk. Ha a lépések sorrendje előre ismert, egy determinisztikus folyamat olcsóbb, gyorsabb és tesztelhető. Ez nem a mi ötletünk: az Anthropic Building Effective Agents írása (2024-12-19) is azt mondja ki, hogy a legtöbb feladatra az előre kódolt workflow jobb, mint az autonóm ügynök. Ügynök oda kell, ahol a lépések száma esetenként változik.
3–4. hét: adat- és jogosultság-előkészítés
Itt bukik el a legtöbb projekt, és itt a legkevésbé látványos a munka. Két kérdést kell lezárni: honnan jön az adat gépi úton, és milyen jogosultsággal fut az ügynök. Ha ez a két hét kimarad, a pilot a hatodik héten áll meg, amikor kiderül, hogy a szükséges mező csak egy PDF-ben létezik.
A jogosultságot a modellen kívül kell megoldani. Az OWASP LLM01 kimondja, hogy a rendszerprompt nem biztonsági kontroll: az authorizáció determinisztikus, a modellen kívüli rétegbe tartozik. A gyakorlatban ez azt jelenti, hogy az adatbázis-felhasználó vagy az API-kulcs az eszköz szintjén korlátozott, read-only és tenant-szintre szűkített. Nem a promptban kérjük meg a modellt, hogy ne nézzen bele más ügyfél adatába.
Simon Willison 2025. június 16-i lethal trifecta megfogalmazása jó ellenőrzőlista: ha az ügynök egyszerre fér hozzá privát adathoz, olvas nem megbízható tartalmat (bejövő e-mail, ügyfélüzenet, weboldal) és tud kifelé kommunikálni, akkor egy megmérgezett szövegdarab adatszivárgáshoz vezethet. A védekezés architekturális: bontsd meg a hármast. Az író eszközök kerüljenek külön ügynökbe, ami nem olvas külső tartalmat.
Magyar nyelvű adaton külön mérés kell
Ha a folyamat magyar dokumentumokon vagy magyar tudásbázison fut, a globális modell-rangsorok nem mondanak semmit. Harang Péter 2025. januári mérése 2132 magyar mondatpáron jelentős átfedést talált a kapcsolódó és a nem kapcsolódó párok hasonlósági eloszlása között, vagyis az embedding-alapú keresés magyarul gyengébben különböztet. Emiatt magyar szövegen a hibrid keresés (kulcsszavas és szemantikus együtt) plusz egy átrendező modell nálunk nem opció, hanem alapbeállítás.
Hogy ez mennyit ér, arra van mért adat: az Anthropic contextual retrieval mérésében a keresési hibaarány 5,7%-ról 2,9%-ra esett a lexikai és szemantikus keresés kombinálásával, átrendezéssel együtt pedig 1,9%-ra. Ez 67%-os javulás ugyanazon a korpuszon, modellcsere nélkül.
5–8. hét: a pilot megépítése
A négy hét építés a legszűkebb működő változatra megy el. Egy ügytípus, egy csatorna, két-három eszköz, minden kockázatos lépés előtt emberi jóváhagyás. A cél nem a lenyűgöző demó, hanem az, hogy a nyolcadik hét végén legyen 100–300 valós eset, amin mérni lehet.
Az eszközhívás strukturált sémával menjen, ne szabad szövegből kiparse-olva. A modell JSON-sémával leírt eszközöket hív, a válasz garantáltan feldolgozható. A régi, szövegparsingos ReAct-minta formátumhibánál futásidejű hibát dob, és ezt éles rendszerben nem akarod hibakeresni. A koncepció maradt, a szállítási rétege változott.
Az eszközkészletet zárd le a legszűkebbre. Az ügynök csak azt lássa, amire a pilot ügytípusához szüksége van, a kódfuttató eszköz izolált konténerben fusson kifelé irányuló hálózati engedélylistával, az író műveletek pedig kerüljenek külön futásba. Ha a rendszereket protokollon keresztül köti be, az MCP 2026. július 28-i specifikációja már állapotmentes maggal, fejléc alapú útválasztással és vállalati jogosultságkezelő kiegészítéssel jön, vagyis ráilleszthető a meglévő API-átjáróra és naplózásra. Ez azért számít, mert egy integrációt így egyszer kell megírni, és utána modellfüggetlen marad.
Mennyi legyen az emberi jóváhagyás aránya?
Induláskor mindenhol több, mint amennyit kényelmesnek gondolsz. Visszafordíthatatlan lépésnél végig 100%: pénzmozgás, ügyfél felé menő kommunikáció, éles rendszerben végzett törlés vagy módosítás, jogi vagy megfelelőségi kimenet.
| Feladat | Mit csinál az ügynök | Emberi jóváhagyás induláskor |
|---|---|---|
| Bejövő számla rögzítése | kiolvasás, kontírozási javaslat, ERP-be írás | 100% két hétig, utána a kivételekre szűkítve |
| Ügyfélszolgálati válasz | válaszjavaslat a tudásbázisból, forrásmegjelöléssel | 100%, amíg a golden dataseten nem stabil |
| Szerződés kivonatolása | mezők kinyerése, kockázati pontok jelölése | a jogi minősítés végig emberé |
| Önéletrajz-szűrés | strukturálás, összevetés a pozícióleírással | kötelező, elutasítást az ügynök nem hozhat |
| Belső riport összeállítása | adatlekérés, szöveges összefoglaló | mintavételes, 10–20% |
Az önéletrajz-szűrés külön eset. A GDPR 22. cikke szerint a kizárólag automatizált, joghatással járó döntés ellen az érintettnek joga van emberi beavatkozást kérni, az AI Act Annex III 4(a) pontja pedig a pályázatok szűrését magas kockázatú felhasználásként sorolja be. A megfelelési naptárt az EU AI Act és GDPR cikkünk bontja le.
Költségkorlát a nyolcadik hét előtt
Az ügynök árát nem a modell határozza meg, hanem a körök száma. A hivatalos Anthropic árlistával számolva ugyanaz az 1000 dokumentum egy egylépéses kinyerő hívással nagyjából 8,7 dollár, egy nyolclépéses ügynöki hurokkal ugyanazon a modellcsaládon 232 dollár. Huszonhétszeres különbség, azonos feladatra. Ezért kell futásonkénti kemény token-plafon, lépésszám-korlát és per-lépés timeout, még a pilot alatt.
9–10. hét: mit mérj a piloton?
Négy számot vezess, plusz a költséget. A golden dataseten mért pontosságot, a hallucináció-arányt, a feladat-teljesítési arányt és az emberi felülbírálati arányt. Ez a négy adja meg, hogy a rendszer élesíthető-e. Vélemények és anekdoták helyett ez az, ami alapján a vezetőség dönteni tud.
| Metrika | Mit mér | Hogyan veszed fel |
|---|---|---|
| Golden dataset pontosság | a rögzített, kézzel ellenőrzött eseteken hány kimenet helyes | 100–300 valós eset, minden prompt- és modellváltás után újrafuttatva |
| Hallucináció-arány | hány válasz tartalmaz olyan állítást, ami a forrásban nincs benne | kötelező forrásmegjelölés, majd heti manuális mintavétel 30–50 esetből |
| Feladat-teljesítési arány | hány eset megy végig emberi beavatkozás nélkül | a futásnaplóból, ügytípusonként bontva |
| Emberi felülbírálati arány | a jóváhagyó hányszor írja át vagy dobja el a javaslatot | a jóváhagyó felületen egy kattintással rögzítve |
| Futásonkénti költség | mennyibe kerül egy lezárt eset tokenben és eszközhívásban | trace-szintű költségriport a megfigyelő rendszerből |
A golden dataset a legolcsóbb dolog, amit meg lehet csinálni, és a legtöbben kihagyják. Vegyél 100–300 lezárt, valós esetet, írd le hozzájuk kézzel a helyes kimenetet, és ez lesz a regressziós teszted. Innentől minden promptmódosítás, modellváltás és eszközcsere előtt lefuttatod. Enélkül a fejlesztő azt fogja mondani, hogy „szerintem jobb lett”, és ez nem elég.
A golden datasetet ne a fejlesztő állítsa össze. A folyamatgazda és a jóváhagyó tudja, mi a helyes kimenet, és melyik eset a nehéz. Két nap munka, jellemzően a kilencedik hét elején. Vegyél bele szándékosan torz eseteket is: hiányos dokumentumot, rossz formátumú dátumot, ismeretlen beszállítót. A könnyű eseteken minden rendszer jól teljesít, a döntést a nehezek hozzák meg.
Az emberi felülbírálati arányból tanulsz a legtöbbet. Ha a jóváhagyó minden harmadik javaslatot átír, akkor nem a modellel van baj, hanem a szabállyal, amit senki nem írt le. Nálunk ez a szám vitte a legtöbbször vissza a projektet a folyamat átgondolásához, és ez jó eredmény, nem kudarc.
A megfigyeléshez nem kell drága eszköz. A Langfuse MIT licenc alatt saját szerveren futtatva nulla licencdíj, felhős csomagja a hivatalos árlista szerint 29 dollártól indul havonta. Aki ennél nagyságrenddel többet számláz tovább monitoringra, az kényelmet ad el.
11–13. hét: éles indulás és visszaállási terv
Az utolsó három hét a fokozatos jogosultság-kiterjesztésről szól. Az ügynök először csak olvas, aztán ír, de minden írást jóváhagynak, végül a legalacsonyabb kockázatú ügytípusokon jóváhagyás nélkül dolgozik. Mindegyik lépés előtt megnézed a négy mért számot, és bármelyik visszaléphet.
A régi folyamatot ne kapcsold ki az első napon. Tartsd életben 30 napig párhuzamosan, kapcsolónként letiltható eszközökkel, hogy egy rossz kimenet ne állítsa meg a napi működést. Írd le előre, ki jogosult a leállításra, és mi történik a félbemaradt esetekkel. Egyetlen mondat, de nélküle a hetedik napon senki nem meri kikapcsolni.
A csapatot is fel kell készíteni. A jóváhagyó szerep új munka, és rosszul csinálva pecsételővé válik: az ember ránéz és nyom egy OK-t. Ez a legrosszabb kimenetel, mert a felelősség formálisan emberi, a döntés viszont nem. Ehhez érdemes fél napot szánni egy céges AI workshopra, ahol a jóváhagyók végigmennek valós hibás eseteken.
A megfelelési határidőket is itt kell lezárni. Az AI Act 50. cikke szerinti átláthatósági kötelezettségek 2026. augusztus 2-tól élnek: ha a rendszer természetes személlyel lép interakcióba, közölni kell, hogy AI-val beszél. A magas kockázatú, Annex III szerinti rendszerek határideje a 2026/1744 rendelettel 2027. december 2-re csúszott, de az átláthatóság nem csúszott.
Mi történik a hatodik hónapban?
Három dolog, amivel a legtöbb ajánlat nem számol. A modellt frissítik és a kimenet megváltozik. A promptok elsodródnak, mert öten módosítottak rajtuk. És kiderül a valódi üzemeltetési költség, ami nem a tokenszámla, hanem emberi munka.
A modellfrissítés nem csak minőségi kérdés. Az Anthropic a Claude 4.7-tel új tokenizálót vezetett be, ami ugyanarra a szövegre nagyjából 30%-kal több tokent produkál, vagyis változatlan milliótokenes ár mellett is drágul a futás. A Google hivatalos árlistája szerint a Gemini 3.6 és 3.7 Flash bevezető ára 2026. december 31-ig érvényes, utána duplázódik. Ha a 2027-es üzemeltetési tervben a mai árakkal számolsz, hibázol.
A prompt-drift ellen ugyanaz véd, mint a modellfrissítés ellen: a golden dataset. A promptok verziókövetésbe kerülnek, minden változás pull requesten megy át, és a regressziós futás a merge feltétele. Ugyanaz a fegyelem, mint bármelyik más kódnál. Aki ezt kihagyja, az fél év múlva nem tudja megmondani, miért lett rosszabb a rendszer.
A karbantartás ára a magyar piacon jellemzően a bevezetési díj évi 15–25%-a (SocialPro, 2026-03-17). A saját árlistánk folyamatautomatizálásnál 30 000–150 000 Ft havi üzemeltetést tartalmaz, a bevezetés pedig chatbot vagy folyamatautomatizálás esetén 1–3 millió Ft, RAG-alapú tudásbázis-rendszernél 3–8 millió Ft. Ebből a modellhasználat a kisebbik tétel. A nagyobbik az, hogy valaki hetente ránéz a hibás esetekre.
Mikor ne indíts AI ügynök projektet?
Öt helyzetben mi magunk mondjuk azt, hogy most ne. Ha a folyamat havi néhány tucatszor fut, ha az adat nem létezik gépi formában, ha nincs megnevezett belső gazda, ha a folyamat úgyis változik egy negyedéven belül, és ha a cél valójában egy létszámdöntés bejelentése.
- Kis volumen. Havi 50 eset alatt a bevezetés és a karbantartás többe kerül, mint a megtakarított idő. Az ilyen folyamatot inkább írd le rendesen, és automatizáld szabályokkal.
- Az adat papíron vagy fejekben van, és nincs, aki rendbe tegye. Az adatelőkészítés önálló projekt. Ha erre nincs kapacitás, az AI réteg csak elfedi a problémát.
- Nincs belső gazda. Kell egy megnevezett ember, akinek a heti munkájában szerepel a hibás kimenetek átnézése. A MIT NANDA 22% és 67% közötti különbsége pontosan erről szól.
- A folyamat három hónapon belül megváltozik. ERP-váltás, szervezet-átalakítás vagy jogszabályváltozás közben épített ügynököt kétszer kell megírni.
- A cél a létszámleépítés kommunikálása. Ilyenkor a kollégák nem adják át a tudást, a jóváhagyók nem jelzik a hibákat, és a projekt csendben elhal. Ez emberi, nem technológiai probléma.
Van egy hatodik eset, ami nem kudarc, csak más megoldás kell. Ha a lépések sorrendje mindig ugyanaz, akkor nem ügynökre van szükség, hanem egy kódolt folyamatra egy-két AI-hívással benne. Olcsóbb, gyorsabb, tesztelhető, és éjjel nem futtat le negyven felesleges kört. A tágabb keretről a digitális transzformációs útmutatónk nyolclépéses módszertana szól.
Összegzés és gyakori kérdések
Tényleg elég 90 nap egy AI ügynök bevezetésére?
Egy folyamatra igen, ha a folyamat körülhatárolt és az adat gépi úton elérhető. A 90 nap két hét folyamatválasztásból, két hét adat- és jogosultság-előkészítésből, négy hét pilotépítésből, két hét mérésből és három hét fokozatos élesítésből áll. Több folyamatra vagy teljes autonómiára nem elég.
Mennyibe kerül egy 90 napos AI ügynök bevezetés Magyarországon?
Az AppForge árlistája szerint egy chatbot vagy folyamatautomatizálás 1–3 millió Ft, egy RAG-alapú tudásbázis-rendszer 3–8 millió Ft, egy összetettebb egyedi AI megoldás 5–15 millió Ft. Az üzemeltetés folyamatautomatizálásnál 30 000–150 000 Ft havonta. A nyers modellköltség ehhez képest kicsi: 500 beszélgetés havonta a hivatalos API-árakkal számolva néhány száz forinttól tízezer forintig terjed.
Melyik folyamattal érdemes kezdeni?
Azzal, ami nagy volumenű, írott szabály szerint megy, olcsón javítható hiba esetén, az adata API-n vagy adatbázisból elérhető, és ma is mérik az átfutási idejét. A cikkben szereplő ötszempontos pontozótáblán ez 21 pont felett van. A ritka, egyedi mérlegelést igénylő, drágán javítható folyamatokkal ne kezdj.
Mekkora emberi jóváhagyási arányt tervezzek induláskor?
Minden visszafordíthatatlan lépésnél 100%-ot: pénzmozgás, ügyfél felé menő kommunikáció, éles rendszerben végzett törlés vagy módosítás, jogi és megfelelőségi kimenet. A többinél az első két hétben szintén 100%, utána a mért hibaarány alapján lehet szűkíteni a kivételekre. Önéletrajz-szűrésnél és hitelbírálatnál az emberi döntés jogszabályi követelmény.
Hogyan mérem, hogy megbízhatóan működik-e az ügynök?
Négy számot érdemes vezetni: a golden dataseten mért pontosságot 100–300 kézzel ellenőrzött valós eseten, a hallucináció-arányt, a feladat-teljesítési arányt (hány eset megy végig emberi beavatkozás nélkül) és az emberi felülbírálati arányt. Ötödikként a futásonkénti költséget. Ezek nélkül a pilot végén csak vélemények lesznek, nem adat.
Mi történik, ha fél év múlva frissítik a modellt?
A kimenet megváltozik, és a promptok egy része elkezd rosszabbul teljesíteni. Ezért kell a golden dataset: modellváltáskor lefuttatod, és látod, mi romlott. Az árazás is mozog, az Anthropic például a Claude 4.7-tel új tokenizálót vezetett be, ami ugyanarra a szövegre nagyjából 30%-kal több tokent produkál.
Megcsinálja a belső IT, vagy kell külső partner?
A MIT Project NANDA 2025 nyári felmérésében a belső szakértő és külső partner kombinációja 67%-os sikerrátát hozott, a kizárólag belső IT által épített rendszerek 22%-ot. Ez nem azt jelenti, hogy külsőst kell fizetni mindenre, hanem azt, hogy a folyamatismeret belül, a rendszerépítési rutin pedig többnyire kívül van.
Mit ír elő az EU AI Act egy ügyfélszolgálati ügynökre 2026-ban?
Az AI Act 50. cikke szerinti átláthatósági kötelezettségek 2026. augusztus 2-tól élnek: ha a rendszer természetes személlyel lép interakcióba, közölni kell, hogy AI-val beszél. A magas kockázatú, Annex III szerinti rendszerek határideje a 2026/1744 rendelettel 2027. december 2-re csúszott, de az átláthatóság nem csúszott.
Ha van egy folyamat, amire a pontozótáblán 21 pont feletti eredmény jött ki, arról 30 percben meg tudjuk mondani, mi fér bele 90 napba és mi nem. Az első két hét eredménye nálunk egy írott hatókör, egy mérési terv és egy ársáv, nem egy prezentáció.


