Servery a VPS

Hosting pro AI aplikace a chatboty: co potřebujete, když web volá OpenAI nebo běží LLM

Přidat na web chatbota nebo AI funkci dnes zvládne skoro každý. Otázka hostingu se ale liší podle jednoho rozhodnutí: voláte cizí API, nebo chcete jazykový model provozovat sami? První scénář zvládne běžný VPS, druhý znamená úplně jinou třídu hardwaru a nákladů. Rozebíráme oba.

· Aug 13, 2026 · aktualizováno Jul 8, 2026
Hosting pro AI aplikace a chatboty: co potřebujete, když web volá OpenAI nebo běží LLM
Ilustrace vygenerovaná pomocí AI
Obsah článku
  1. Scénář 1: Web jen volá cizí AI API
  2. Scénář 2: Web běží vlastní / lokální LLM
  3. Jak se rozhodnout: rychlá orientace

AI funkce se za poslední dva roky přesunuly z experimentu do běžného provozu. Chatbot na e-shopu, generování popisů produktů, sumarizace dotazů na podpoře — to všechno dnes běží i na malých českých webech. A skoro pokaždé přijde stejná otázka: musím kvůli tomu měnit hosting?

Odpověď závisí na jedné jediné věci. Buď vaše aplikace jen volá cizí AI API (OpenAI, Anthropic, Google), nebo si chcete jazykový model provozovat sami. Jsou to dva úplně jiné světy s jiným hardwarem, jinou cenou a jinými riziky. Pojďme je rozebrat odděleně.

Scénář 1: Web jen volá cizí AI API

Toto je 95 % reálných nasazení. Váš server dostane dotaz od uživatele, pošle ho přes HTTPS do OpenAI nebo Anthropic, počká na odpověď a vrátí ji zpět. Veškerý těžký výpočet — samotný model — běží u poskytovatele. Váš hosting jen předává data.

Z pohledu hardwaru je to překvapivě nenáročné. Nepotřebujete GPU, nepotřebujete desítky gigabajtů RAM. Potřebujete stabilní PHP/Node/Python backend, který umí odejít na cizí endpoint a v klidu počkat. Běžný VPS s 2 jádry a 2–4 GB RAM bohatě stačí i pro slušně vytížený web.

Háček není ve výkonu, ale v provozních detailech. Ty rozhodují, jestli vám AI funkce bude fungovat spolehlivě, nebo bude padat a prodražovat se.

Sdílený hosting vs. VPS

Sdílený hosting může stačit, pokud jde jen o pár volání denně a poskytovatel povoluje odchozí HTTPS spojení na cizí API. V praxi ale narazíte na tři limity:

  • Timeouty. AI odpověď může trvat 5–30 sekund, streamovaná i déle. Sdílené hostingy často zabíjejí PHP skript po 30 sekundách nebo dřív. Delší generování prostě spadne.
  • Blokovaná odchozí spojení. Někteří poskytovatelé filtrují cURL na externí adresy.
  • Žádné fronty a workery. Nemůžete rozumně spustit proces na pozadí.

Proto se pro cokoli víc než ozdobný chatbot vyplatí VPS. Máte kontrolu nad timeouty, můžete rozběhnout frontu a nikdo vám nezabije dlouho běžící požadavek. Pokud řešíte, jestli VPS vůbec, přečtěte si i srovnání české VPS a cloud hostingu pro rostoucí web nebo e-shop — logika je stejná i tady.

Co musíte vyřešit na úrovni aplikace

Hardware je ta snadná část. Následující body odliší funkční nasazení od průšvihu:

  • Fronty a zpracování na pozadí. Nenechte uživatele viset na synchronním požadavku 20 sekund. U delších úloh (generování textu, hromadné zpracování) použijte frontu — Redis, databázový job nebo message broker — a výsledek doručte asynchronně. Ušetří vám to spadlá spojení i frustrované návštěvníky.
  • Timeouty a retry. Nastavte rozumný timeout na volání API (např. 60 s) a exponenciální retry pro případ, že poskytovatel vrátí chybu 429 nebo 503. AI API mají rate limity a občas prostě odmítnou.
  • Streamování odpovědí. Pokud chcete efekt "píšícího" chatbota, potřebujete server, který umí držet otevřené SSE spojení. Sdílený hosting to typicky neumí, VPS ano.
  • Cache. Opakující se dotazy (FAQ, stejný produkt) cachujte. Každé volání API něco stojí — o tom níže.

Bezpečnost: klíče, limity, prompt injection

Tohle je nejčastější místo, kde weby s AI chybují.

API klíče nikdy nedávejte do frontendu. Klíč do OpenAI či Anthropic patří výhradně na server, ideálně do proměnných prostředí (.env mimo webroot, nebo systémové env), nikdy do gitu a nikdy do JavaScriptu v prohlížeči. Uniklý klíč znamená, že vám někdo cizí protočí kredit — a účty za tokeny umí být bolestivé.

Rate limiting na vlastní straně. Poskytovatel má své limity, ale vy musíte mít i své. Bez omezení počtu dotazů na IP nebo uživatele vám může jeden skript vygenerovat účet za tisíce korun během noci. Nastavte strop.

Prompt injection. Pokud chatbot čte uživatelský vstup a předává ho modelu, počítejte s tím, že se ho někdo pokusí zmanipulovat ("ignoruj předchozí instrukce a…"). Nikdy nedávejte modelu přímý přístup k citlivým akcím (mazání dat, odesílání e-mailů) bez validace na vaší straně. Výstup modelu berte jako neověřený vstup, ne jako příkaz.

Náklady u scénáře 1

Rozdělte si je na dvě části:

Položka Řádová cena (2026)
VPS (2 jádra, 4 GB RAM) u českého poskytovatele 200–500 Kč / měsíc
Volání AI API (tokeny) podle využití, klidně od desítek Kč po tisíce Kč / měsíc

Klíčové je, že cena hostingu je předvídatelná, cena tokenů ne. Účet za API roste s provozem a s délkou promptů. Proto hlídejte spotřebu tokenů, nastavte v dashboardu poskytovatele měsíční limit útraty a logujte, kolik vás jednotlivé funkce stojí. Levné modely (menší varianty) zvládnou většinu běžných úloh za zlomek ceny těch nejsilnějších.

Scénář 2: Web běží vlastní / lokální LLM

Druhý svět. Sem se dostanete, když nechcete data posílat ven (GDPR, citlivé dokumenty), chcete plnou kontrolu, nebo počítáte, že se vám vlastní provoz při velkém objemu vyplatí. Provozovat model znamená mít po ruce jeho váhy a dost výpočetního výkonu, aby na nich běžela inference.

Tady se náročnost mění o několik řádů.

Malé modely na CPU/RAM

Menší open-weight modely (řádově jednotky miliard parametrů, kvantizované) se dají rozběhnout i na výkonnějším VPS bez GPU — nástroje jako Ollama nebo llama.cpp to umožňují. Očekávejte:

  • RAM: minimálně 8–16 GB, ideálně víc. Model se musí vejít do paměti.
  • Rychlost: na CPU pomalá. Pro osobní nástroj nebo dávkové zpracování na pozadí OK, pro živý chat s desítkami uživatelů ne.

Toto je rozumná volba, když chcete AI "in-house" pro interní účely a nevadí vám nižší rychlost.

Větší modely potřebují GPU

Jakmile chcete kvalitu blízkou komerčním API a slušnou rychlost při více uživatelích, potřebujete GPU server. GPU s dostatkem VRAM (řádově 24 GB a výš u větších modelů) je to, co dělá inference použitelně rychlou. A tady narazíte na dvě věci:

  • Cena. Dedikovaný server s výkonnou GPU se v pronájmu pohybuje řádově v tisících až desetitisících korun měsíčně. Nákup vlastního hardwaru jde do statisíců.
  • Dostupnost u českých poskytovatelů. GPU servery nabízí jen část tuzemského trhu a často jde o řešení na dotaz, ne z ceníku. Řada firem proto sáhne po zahraničních GPU cloudech účtovaných po hodinách — platíte jen za dobu, kdy model skutečně počítá.

Kdy se vlastní LLM vyplatí

Poctivě: pro většinu webů se nevyplatí. Ekonomika je jednoduchá — dokud vám měsíční účet za cizí API nepřeroste náklady na GPU server a jeho správu, je volání API levnější, rychlejší na nasazení a bez starostí o provoz. Vlastní model dává smysl, když:

  • data nesmí opustit vaši infrastrukturu,
  • máte tak velký a stálý objem, že se GPU vyplatí naplno vytížit,
  • potřebujete specifický doladěný (fine-tunovaný) model.

Jinak zůstaňte u scénáře 1.

Jak se rozhodnout: rychlá orientace

  • Pár AI funkcí, voláte OpenAI/Anthropic → běžný VPS, 200–500 Kč/měsíc, vyřešte klíče, timeouty, fronty a limity útraty.
  • Ozdobný chatbot, minimum provozu → možná stačí i sdílený hosting, ale ověřte si timeouty a odchozí spojení.
  • Interní AI nástroj, citlivá data, nevadí nižší rychlost → silnější VPS s Ollamou, malý model na CPU.
  • Vlastní model v produkci pro veřejnost → GPU server, počítejte s výrazně vyššími náklady a správou.

Ve většině případů je nejrozumnější cesta ta nejnudnější: obyčejný VPS, cizí API a poctivě ošetřená aplikační vrstva. Hardware vás nezradí — zradí vás uniklý klíč, chybějící strop útraty nebo timeout, na který jste zapomněli.

Zdroje

  • OpenAI — dokumentace k API, rate limitům a bezpečnému nakládání s klíči platform.openai.com
  • Anthropic — dokumentace k Claude API a best practices docs.anthropic.com
  • Ollama — nástroj pro lokální provoz open-weight LLM ollama.com
  • OWASP — Top 10 rizik pro aplikace s LLM (prompt injection ad.) owasp.org