Agent souverain sur mesure · 3 900 €

VOS DONNEES
NE QUITTENT JAMAIS
VOTRE SERVEUR.

Une stack souveraine deployee sur votre infrastructure : selon votre machine, votre budget et votre implication, on installe OpenClaw, Hermes ou un LLM local pur (Ollama + modele ouvert) — un agent qui garde sa memoire chez vous. Aucune dependance cloud. RGPD blinde. Compatible mairies, cabinets juridiques, sante, defense. Cette page detaille comment je vous installe, vous forme, et evalue votre hardware.

01 / Installation

INSTALLE SUR LINUX, MAC, WINDOWS.

Je deploie la voie choisie (OpenClaw, Hermes ou Ollama) sur les 3 OS principaux, en une journee. Les installeurs sont natifs sur Linux, macOS et Windows (PowerShell, plus besoin de WSL2).

Linux

3-5h
Ubuntu / Debian / Arch
  • 01Audit distro + version kernel + GPU
  • 02Install Ollama + agent souverain (OpenClaw ou Hermes)
  • 03Pull modele : Qwen3 30B-A3B ou Mistral (contexte 64k)
  • 04Services systemd : Ollama + agent au boot
  • 05Reverse proxy Nginx + Let's Encrypt
  • 06Hardening UFW + fail2ban · skill packs + gateway

macOS

3-4h
M1/M2/M3 · Intel
  • 01Detection Apple Silicon / Intel
  • 02Install Ollama (DMG) + agent souverain (OpenClaw ou Hermes)
  • 03Optimisation Metal pour M1+
  • 04LaunchAgent auto-start au boot
  • 05Tunnel HTTPS via Tailscale ou Cloudflare
  • 06Test charge selon RAM · skill packs + gateway

Windows

3-4h
natif · PowerShell
  • 01Audit GPU NVIDIA + RAM + disque
  • 02Install Ollama Windows + agent souverain (installeur natif, 60 s)
  • 03Contexte 64k : OLLAMA_CONTEXT_LENGTH au niveau service
  • 04Modele Qwen3 30B-A3B ou Mistral selon VRAM
  • 05Tache planifiee Windows : demarrage au boot
  • 06Skill packs + gateway (mail, Teams, WhatsApp, SMS)
02 / L'agent

UN AGENT QUI APPREND SEUL.
CHEZ VOUS. SANS ABONNEMENT.

Selon votre machine, on installe OpenClaw (plateforme d'agents accessible) ou Hermes (runtime open source, licence MIT, Nous Research). Dans les deux cas, l'agent ne se contente pas de repondre : il cree ses propres competences a l'usage, garde sa memoire sur votre serveur et tourne en tache planifiee. Je l'installe avec Ollama et un modele ouvert, je le livre avec des skill packs metier deja eprouves, et il continue d'evoluer sans moi.

Skills auto-crees

L'agent transforme ce qu'il a reussi en competence reutilisable (format ouvert SKILL.md). Vous livrez les vôtres, il fabrique les suivantes.

Memoire locale

Il se souvient d'une session a l'autre, de vos documents, de vos habitudes. Tout reste dans votre base, jamais dans un cloud.

Cron + messageries

Rapports du lundi, relances, veille : planifies en interne et livres par mail, Teams, WhatsApp, SMS ou Signal, au choix.

Evolution a 120 €

Tous les 4 mois, une mise a jour signee vous est proposee (nouveaux packs, nouveau modele). Vous refusez ? Rien ne se degrade.

* Usage agentique avec outils : contexte 64 000 tokens et modele a appel d'outils (Qwen3 30B-A3B recommande). Verifie le 12.09.2026.

03 / Modeles

LLM GRATUITS OU VOS API KEYS.
VOUS CHOISISSEZ.

Vous decidez du compromis perf / cout / privacy. Je peux deployer 100% local gratuit, hybride, ou full API. Et vous accompagner pour migrer entre les options selon votre maturite.

Option A · 100% Local Gratuit

LLM open-source offerts

Modeles libres / open-source pre-installes selon votre hardware et besoin metier.

  • Qwen 2.5 7B / 14B / 72B (Alibaba) — meilleur generaliste
  • Llama 3.1 8B / 70B (Meta) — robuste, francophone OK
  • Mistral 7B / Mixtral 8x7B (Mistral AI · FR) — top en francais
  • Phi-3 Mini 3.8B (Microsoft) — ultra-leger pour petite RAM
  • Code Qwen / Code Llama pour generation code
  • Whisper (OpenAI open-source) pour transcription audio
Cout : 0 € / mois · Donnees jamais sortantes
Option B · API Keys

Vos cles API premium

Si vous voulez la perf maximale, je branche vos cles API directement dans la stack.

  • Anthropic Claude (Sonnet / Opus) — meilleur LLM 2026
  • OpenAI GPT-4o / GPT-5 — referent generaliste
  • Mistral Large API (souverain europeen)
  • Google Gemini 2.5 Pro / Flash
  • Cohere Command R+ (RAG specialiste)
  • Hybride : routage selon type de requete (cout-perf optimise)
Cout : pay-per-token · Vos cles, votre facturation
04 / Formation

JE FORME VOTRE EQUIPE A TOUT CA.

Apres l'installation, je forme votre equipe technique a operer la stack en autonomie. Curriculum decoupe en 3 modules.

MODULE 01
6h hands-on

Module Operation (1 jour)

  • Architecture agent souverain + Ollama : comprendre les briques
  • CLI Ollama et agent (OpenClaw / Hermes) : modeles, skills, memoire, cron
  • Lecture des logs, monitoring CPU/RAM/GPU
  • Basculer entre modeles selon le besoin metier
  • Restart / debug en autonomie
MODULE 02
6h theorie + pratique

Module Prompting (1 jour)

  • Anatomie d'un bon system prompt
  • RAG : indexer vos documents internes
  • Comparer perf des modeles sur vos cas d'usage
  • Ecrire un skill pack (SKILL.md) et le faire apprendre a l'agent
  • Limites & risques : hallucinations, jailbreak
MODULE 03
3h checklist

Module Maintenance (1/2 jour)

  • Mises a jour modeles + securite OS
  • Sauvegardes : configs, embeddings, FAQ
  • Procedure de restauration apres crash
  • Quand m'appeler en renfort (escalade)
  • Documentation interne fournie
Tarif formation 2.5 jours
3 750 € HT

Module independant. Le forfait Agent souverain sur mesure 3 900 € inclut 2 h de prise en main ; ces 2,5 jours s\'ajoutent quand l\'equipe doit operer la stack sans moi.

05 / Hardware

AUDIT PUISSANCE.
ON CALCULE CE QUE VOUS POUVEZ FAIRE TOURNER.

Avant tout deploiement, j'audite votre serveur ou je vous aide a choisir le bon. Voici la grille d'evaluation que j'utilise.

Configuration
Modele recommande
Vitesse
Usage adapte
8 GB RAM · CPU only
Phi-3 Mini 3.8B
~5 tok/s
POC, demo, FAQ simple
16 GB RAM · CPU only
Qwen 2.5 7B / Mistral 7B
~3 tok/s
Petite asso, FAQ enrichie
16 GB + GPU 8GB VRAM
Qwen 2.5 7B GPU
~25 tok/s
Mairie petite, cabinet
32 GB + RTX 3080/4080
Qwen3 30B-A3B (agent, outils)
~40 tok/s
PME · mairie · usage prod, agent complet
64 GB + RTX 4090 / A6000
Qwen3 30B-A3B / Llama 70B Q4
~30 tok/s
Grande structure, multi-utilisateurs
VPS Hostinger KVM2 (16 GB)
Qwen 2.5 7B
~3 tok/s
MVP, demo client, low-traffic
Serveur dedie + GPU H100
Llama 70B / Qwen 72B full
~80 tok/s
Industriel, multi-tenant

* Vitesses indicatives en quantization Q4_K_M · varient selon contexte, longueur prompt et OS · un agent avec outils exige 64k de contexte et un modele a appel d\'outils : en dessous de 16 Go de VRAM, on livre un chatbot, pas un agent

agent souverain sur mesure · 3 900 € · 5 jours

PRET POUR L\'INDEPENDANCE ?

On audite votre infrastructure, on installe la voie souveraine adaptee et le modele, je forme votre equipe. Resultat : un agent qui apprend chez vous, sur votre serveur, sans dependance cloud ni abonnement.