LIVE
modèles5/5 up
gatewayOK
p50263ms
p95263ms
txeu-fr · electron-server
№ 02 · modèles servis

Modèles finaux & auto-router.

Les workers actifs, l'auto-router agentique, le statut de la flotte, les scores bench origine vs tuné, le chemin d'une requête, et le playground — sur une seule page.

L'auto-router, par domaine.

Le prompt entre. Un classifier embeddings le situe sur l'un des 47 domaines. Le routeur ouvre la politique YAML correspondante et choisit le spécialiste. Sur les domaines hardware, la sortie passe par un validator Docker sandboxé avant retour utilisateur.

1
Prompt utilisateur
« Génère le schéma KiCad d'un convertisseur boost 12V→24V »
POST /api/public/chat
2
Classifier multilingual-e5-large + MLP
multilingual-e5-large 1024d (GPU gateway, Tower) · MLP 2 couches (hidden 256) · 47 domaines · cache L1 hash + L2 cosinus sémantique
kicadspicestm32emcembeddedcodemath
domaine ∈ HARDWARE_DOMAINS ?
Branche hardware
3a
Spécialiste qwen36-*
LoRA qwen36-35B hot-swap fine-tunée sur le domaine (kicad / spice / stm32 / emc / embedded / power…) · serveurs multi-LoRA :9360 / :9361
sortie LLM
4a
Validator Docker sandboxé
--network=none --read-only --cap-drop=ALL · KiCad DRC, ngspice, g++, shellcheck, tsc, FreeCAD scripting…
exit ≠ 0 → reflector retry
Branche directe
3b
Backend généraliste
Qwen3-Coder-Next 80B (16 domaines code) · Mistral-Medium 128B · EuroLLM 22B (multilingue) · Devstral-Small 24B · Mistral-Small 3.1 (vision) — servis via vllm-mlx :8500
sortie directe
Pas de validator
Math, traduction et généraliste restent en politique direct (1-shot).
NDJSON audit trail · SSE retour utilisateur
5
Réponse streamée à l'utilisateur
Audit-grade : prompt_hash, output_hash, seed, validator_image_digest tous loggés en NDJSON pour rejouabilité Annex IV

Statut de la flotte.

Gateway et workers actifs, sondés en direct via /api/public/status toutes les 15 secondes. 5 / 5 healthy.

gateway :9300 (Tower) · router v9.2 · live probe5 / 5 healthy
Mac Studio · vllm-mlx multi-model :8500
studio · studio-vllm-mlx
GPU · Apple M3 Ultra (76-core GPU) · 512 GB
38 modèles servis
Ministral-3-14B-Instruct-2512-MLX-4bitMinistral-3-14B-Reasoning-2512-MLX-4bitQwen3-Coder-30B-A3B-Instruct-MLX-4bitQwen3-Coder-30B-A3B-Instruct-MLX-4bit-DWQDeepSeek-R1-Distill-Qwen-32B-MLX-4bitDevstral-Small-2-24B-Instruct-2512-MLX-4bitEuroLLM-22B-Instruct-2512Mistral-Small-3.1-24B-Instruct-MLX-4bitLlama-3.3-70B-Instruct-MLX-4bitQwen3.6-27B-MLX-BF16Mistral-Medium-3.5-128B-MLX-4bitMistral-Small-4-119B-2603-4bitQwen3-235B-A22B-Instruct-2507-MLX-4bitQwen3-Coder-Next-MLX-8bitapertus-70b-electronics-hw-8bitapertus-70b-embedded-8bitapertus-70b-emc-dsp-power-8bitapertus-70b-math-8bitapertus-70b-security-fenrir-8bitapertus-70b-spice-sim-8bitdevstral-cppdevstral-pythondevstral-rust-embeddedgemma-4-E4B-it-MLX-4bitgemma-4-e4b-eukiki-fusedgemma-4-e4b-mascarade-fusedpixtral-12b-8bitMagistral-Small-2509-MLX-8bitgemma-4-26B-A4B-it-MLX-8bitgpt-oss-20b-schgen-fusedqwen36-27b-baseapertus-70b-basegemma-4-31b-it-8bitgranite4-tinygranite41-8bOrnith-1.0-9B-MLX-BF16Ornith-1.0-35B-MLX-BF16qwen36-35b-base
latence
203 ms
GPU
VRAM
temp
tokens / j
14.8 k
kWh / j
~5.16
état
UP
Mac Studio · Qwen3.6-35B multi-LoRA (hardware/EDA/math) :9360
studio · studio-qwen36-hardware
GPU · Apple M3 Ultra (76-core GPU) · 512 GB
31 modèles servis
baseqwen36-chat-frqwen36-cppqwen36-docker-devopsqwen36-embeddedqwen36-emc-dsp-powerqwen36-freecadqwen36-html-cssqwen36-iotqwen36-kicad-dslqwen36-kicad-pcbqwen36-llm-opsqwen36-llm-orchqwen36-lua-upyqwen36-math-gsm8kqwen36-math-reasoningqwen36-ml-trainingqwen36-multilingual-euqwen36-music-audioqwen36-platformioqwen36-rustqwen36-rust-embeddedqwen36-security-fenrirqwen36-shellqwen36-spice-simqwen36-sqlqwen36-traduction-techqwen36-typescriptqwen36-web-backendqwen36-web-frontendqwen36-yaml-json
latence
263 ms
GPU
VRAM
temp
tokens / j
kWh / j
~5.16
état
UP
Mac Studio · Qwen3.6-35B multi-LoRA (code/web/lang) :9361
studio · studio-qwen36-code
GPU · Apple M3 Ultra (76-core GPU) · 512 GB
31 modèles servis
baseqwen36-chat-frqwen36-cppqwen36-docker-devopsqwen36-embeddedqwen36-emc-dsp-powerqwen36-freecadqwen36-html-cssqwen36-iotqwen36-kicad-dslqwen36-kicad-pcbqwen36-llm-opsqwen36-llm-orchqwen36-lua-upyqwen36-math-gsm8kqwen36-math-reasoningqwen36-ml-trainingqwen36-multilingual-euqwen36-music-audioqwen36-platformioqwen36-rustqwen36-rust-embeddedqwen36-security-fenrirqwen36-shellqwen36-spice-simqwen36-sqlqwen36-traduction-techqwen36-typescriptqwen36-web-backendqwen36-web-frontendqwen36-yaml-json
latence
263 ms
GPU
VRAM
temp
tokens / j
kWh / j
~5.16
état
UP
macM1 · vllm-mlx FC hot-path (granite) :8520
macm1 · macm1-granite-fc
GPU · Apple M1 (integrated GPU) · 32 GB
2 modèles servis
granite41-8b (FC, prompts ≤32k tokens)granite4-tiny (FC, 1M context)
latence
76 ms
GPU
VRAM
temp
tokens / j
kWh / j
~0.94
état
UP
KXKM-AI · gpu-swap on-demand (RTX 4090) :8005
kxkm-ai (RTX 4090, autossh tunnel) · kxkm-gpu-swap
GPU · NVIDIA RTX 4090 (24 GB) · 24 GB
3 modèles servis
qwen3-coder-30b (FC failover)gpt-oss-20b + SchGen LoRAqwen3-vl-30b (vision)
latence
8016 ms
GPU
VRAM
temp
tokens / j
kWh / j
~10.80
état
UP
charge et tokens / j = lecture live si le worker expose ces compteurs, sinon « — ». kWh / j = estimation conservatrice TDP × 24h / 1000 (valeur enveloppe, pas la consommation réelle mesurée).

Bench — origine vs tuné.

iact-bench v1, sandbox Docker épinglé par digest. Score = % cellules avec validator exit-zéro. Origine = modèle base sans routage. Tuné = via auto-router + validator chain.

DomaineOrigineTunéΔModèle
KiCad DSL12%67%+55ailiance/auto
KiCad PCB18%60%+42ailiance/auto
SPICE simulation21%46%+25ailiance/auto
STM32 embedded28%71%+43ailiance/auto
EMC analysis24%58%+34ailiance/auto
Power electronics31%64%+33ailiance/auto

Source : iact-bench · seed crc32(domaine + index) · digest validator sha256 épinglé

Catalogue final.

Les workers actifs (LIVE) et les références featured du catalogue. Pour le catalogue HuggingFace complet (24 adaptateurs), voir la model card de chaque entrée.

ailiance/mistral-medium-3.5-128b

Mistral Medium 3.5 128B

LIVE

128B params · MLX Q8 · 262k context · vllm-mlx (Mac Studio M3 Ultra)

baseMistral Medium 3.5 128B
params128 B
quantMLX Q8
formatMLX
mémoire130.0 GB
disque124.0 GB
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindQUANTIZED
MT-Bench87%
MT-BenchAnnex IV →
ailiance/qwen3-coder-next-80b

Qwen3-Coder-Next 80B

LIVE

80B MoE / 3B active · MLX 8-bit · vllm-mlx (Mac Studio)

baseQwen/Qwen3-Coder-Next-80B-A3B
params80 B
quantMLX 8-bit
formatMLX
mémoire50.0 GB
disque45.1 GB
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindQUANTIZED
MMLU / GSM8K91%
MMLU / GSM8KAnnex IV →
ailiance/granite-30b

Granite 4.1 (function calling)

LIVE

FC hot-path · granite41-8b / granite4-tiny 1M ctx · vllm-mlx (macM1 :8520)

baseibm-granite/granite-4.1-8b + granite-4.0-tiny
params8.0 B
quantMLX
formatMLX
mémoire6.0 GB
disque5.0 GB
hostmacm1 (vllm-mlx :8520, Apple M1)
kindQUANTIZED
HumanEval+ / BigBench-Hard code83%
HumanEval+ / BigBench-Hard codeAnnex IV →
ailiance/eurollm-22b

EuroLLM 22B Instruct

LIVE

22B · multilingual EU · vllm-mlx (Mac Studio)

baseutter-project/EuroLLM-22B-Instruct
params22 B
quantMLX
formatMLX
mémoire45.0 GB
disque45.0 GB
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindQUANTIZED
MT-Bench (multilingual)74%
MT-Bench (multilingual)Annex IV →
ailiance/apertus-70b

Apertus 70B Instruct

LIVE

70B · MLX 4-bit · vllm-mlx (Mac Studio)

baseswiss-ai/Apertus-70B-Instruct-2509
params70 B
quantMLX 4-bit
formatMLX
mémoire40.0 GB
disque37.0 GB
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindQUANTIZED
MMLU80%
ailiance/vision-eu

Vision EU (Mistral Small 3.1)

LIVE

vision · 24B multimodal · vllm-mlx (Mac Studio)

basemistralai/Mistral-Small-3.1-24B-Instruct
params
quant
formatMLX
mémoire
disque
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindQUANTIZED
MMMU vision74%
MMMU visionAnnex IV →
ailiance/reasoning-r1

Reasoning R1

LIVE

chain-of-thought · reasoning · vllm-mlx (Mac Studio)

baseDeepSeek-R1-Distill-Qwen-32B
params
quant
formatMLX
mémoire
disque
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindDISTILLED
AIME / MATH89%
AIME / MATHAnnex IV →
ailiance/coder-pro

Coder Pro

LIVE

code · validators · vllm-mlx (Mac Studio)

baseQwen/Qwen3-Coder-Next-80B-A3B
params
quant
formatMLX
mémoire
disque
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindQUANTIZED
HumanEval+ / MultiPL-E86%
HumanEval+ / MultiPL-EAnnex IV →
ailiance/mistral-small-3.1

Mistral Small 3.1

LIVE

24B · général · fast · vllm-mlx (Mac Studio)

basemistralai/Mistral-Small-3.1-24B-Instruct
params
quant
formatMLX
mémoire
disque
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindQUANTIZED
MT-Bench79%
MT-BenchAnnex IV →
ailiance/devstral-base

Devstral Small 2 24B

LIVE

24B · MLX · vllm-mlx (Mac Studio)

basemistralai/Devstral-Small-2-24B
params24 B
quantMLX
formatMLX
mémoire15.0 GB
disque14.0 GB
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindQUANTIZED
SWE-bench Verified84%
SWE-bench VerifiedAnnex IV →
ailiance/flagship

Flagship — Qwen3-235B-A22B

LIVE

235B MoE / 22B actifs · MLX 4-bit · vllm-mlx (Mac Studio)

baseQwen/Qwen3-235B-A22B-Instruct-2507
params235 B
quantMLX 4-bit
formatMLX
mémoire125.0 GB
disque
hoststudio (vllm-mlx :8500, Mac Studio M3 Ultra)
kindQUANTIZED
iact-benchAnnex IV →
ailiance/mtplx-35b

MTPLX 35B (speed-optimized)

LIVE

35B MoE / 3B actifs · speed-optimized · macM1 :8080

baseQwen/Qwen3.6-35B-A3B
params35 B
quantMLX
formatMLX
mémoire20.0 GB
disque
hostmacm1 (MTPLX daemon :8080, Apple M1)
kindQUANTIZED
iact-benchAnnex IV →
ailiance/auto

Auto-router

LIVE

multilingual-e5-large 1024d · 47 domains · val top-1 0.923 · router v9.2

baseintfloat/multilingual-e5-large 1024d + 2-layer MLP (hidden 256)
params560 M
quantFP32
formatSAFETENSORS
mémoire2.5 GB
disque2.1 GB
hosttower (gateway :9300, NVIDIA P2000)
kindFINE_TUNED
router v9.2 val top-1 (47 domains)92%
router v9.2 val top-1 (47 domains)Annex IV →
ailiance/mascarade

Mascarade · LoRAs spécialistes qwen36

LIVE

Qwen3.6-35B + LoRAs · multi-LoRA :9360/:9361 (Mac Studio) · validator sandbox

baseQwen3.6-35B-A3B + LoRA
params35 B
quantMLX bf16 + LoRA
formatMLX
mémoire70.0 GB
disque70.0 GB
hoststudio (multi-LoRA :9360/:9361, Mac Studio M3 Ultra)
kindLORA
iact-bench hardware avg62%
iact-bench hardware avgAnnex IV →

Playground — auto-router.

Le playground utilise l'alias ailiance (auto-router) par défaut. Pour tester un modèle spécifique, ouvrez sa fiche depuis le catalogue ci-dessus. 30 requêtes / minute / IP, sans inscription ni clé d'API.

Démonstration sur demande

Chat indisponible au public.

Le matériel ailiance qui sert ces modèles n'est pas accessible au public. Pour les essayer en conditions réelles — ou les déployer sur votre infrastructure — demandez une démonstration : nous vous ouvrons un accès dédié.

Demander une démonstration