Демо зібране під ваші дві задачі. Перемикач нижче показує, що змінюється у виборі моделі й заліза, коли задача інженерна, а коли документна — це різні вимоги, і одна конфігурація під обидві не оптимальна.
Під кожну задачу підходять різні моделі: інженерний контур упирається в якість міркування і роботу з кодом, документний — у довгий контекст і українську мову.
Ключове для цієї задачі: якість міркування, робота зі скриптами параметризації (Python/API вашої CAD), точне цитування нормативів без вигадування.
| Модель | Розмір | Квантизація | Потрібно VRAM | Швидкість | Придатність |
|---|---|---|---|---|---|
| Qwen3 30B (MoE) | 30B, активних ~3B | Q4_K_M | ~20 ГБ | висока | робочий баланс |
| Qwen3 32B | 32B | Q4_K_M | ~22 ГБ | середня | сильне міркування |
| Llama 3.3 70B | 70B | Q4_K_M | ~42 ГБ | нижча | потрібні 2 карти |
| Gemma 3 27B | 27B | Q4_K_M | ~18 ГБ | висока | добра українська |
| Qwen3 14B | 14B | Q5_K_M | ~11 ГБ | дуже висока | довгий контекст |
| Qwen3 8B | 8B | Q5_K_M | ~7 ГБ | дуже висока | мінімум, для тесту |
Остаточний вибір роблю не за таблицею з інтернету, а прогоном 2-3 кандидатів на ваших реальних документах і кресленнях. Різниця між моделями на чужих бенчмарках і на вашому матеріалі — це і є те, за що має сенс платити за підбір.
Ціни орієнтовні, ринок України, вересень 2026; уточнюю під час підбору за наявністю в постачальників. Головне тут не ціна, а що кожен варіант реально тягне.
~60-75 тис. грн
RTX 3090/4090 24 ГБ, 64 ГБ RAM. Тягне моделі до 32B у Q4, контекст до ~32k. Одночасно 1-2 користувачі.
Не тягне: 70B без сильної втрати якості.
~120-150 тис. грн
Дві карти по 24 ГБ, 128 ГБ RAM. Тягне 70B у Q4, довгий контекст, 3-5 користувачів паралельно.
Тут з'являється: запас під зростання бази документів.
від ~250 тис. грн
Професійна карта (RTX 6000 Ada / A6000). Одна карта замість двох — тихіше, простіше з живленням і охолодженням.
Має сенс: якщо сервер ставиться в офісі, а не в серверній.
Пише і править скрипти під API вашої CAD (SolidWorks, Inventor, Fusion, FreeCAD): серії типорозмірів, пакетна зміна параметрів, вивантаження специфікацій. Результат перевіряє сама CAD — це головне.
Відповідає по вашій базі стандартів із посиланням на конкретний пункт документа. Без пункту відповідь не приймається — налаштовується як жорстке правило.
Пояснює, чому не будується модель, що означає помилка солвера, де конфлікт у сполученнях. Тут вона сильна, бо працює з текстом, а не з числом.
Складає BOM з вивантаження, готує супровідні документи за вашим шаблоном, звіряє креслення зі специфікацією і показує розбіжності.
FEM, напруження, деформації, теплові розрахунки — рахує солвер, не модель. Відповідь LLM тут виглядатиме впевнено і буде неперевіреною.
Будь-яку відповідь із числом, у якої немає посилання на ваш документ або на результат солвера, система має позначати як непідтверджену. Це налаштовується.
Документи не «завантажуються в модель». Вони індексуються локально, і модель відповідає, цитуючи знайдений фрагмент із назвою файлу та сторінкою.
Уся база лишається на вашому сервері. Жоден документ не йде у зовнішній сервіс — це, як правило, і є причина, чому сервер ставлять локально, а не беруть хмарну підписку.