Как запустить ИИ на GeForce RTX 40xx и 50xx и работать с договорами и персональными данными полностью офлайн. Таблица «видеокарта - модель» и готовая связка.
Есть вопросы или хочешь обсудить?
Обсудить в Telegram →Каждый раз, когда вы вставляете договор в ChatGPT и просите «найди риски», этот договор улетает на сервер провайдера. Дальше вы не контролируете ничего. По условиям использования его могут хранить, обрабатывать, в отдельных случаях просматривать люди. Для рекламного текста это неважно. Для трудового договора, базы клиентов или медицинской карты - уже проблема.
Хорошая новость: если у вас в компьютере стоит игровая видеокарта GeForce RTX, ИИ можно поставить прямо на неё. Модель работает локально, документы никуда не отправляются, а после установки можно вообще выдернуть интернет. Разберём, как это сделать, без магии и без покупки серверной стойки.
Смысл простой: модель и ваши файлы физически лежат на вашем диске. Когда вы задаёте вопрос по документу, обработка идёт внутри вашей же машины, на вашей видеокарте. Наружу не уходит ни байт.
Что это даёт на практике:
Отдельная выгода - деньги. Толковый помощник, который весь день читает ваши документы и отвечает по ним, в найме стоил бы десятки тысяч рублей в месяц. Локальная модель делает похожую черновую работу за стоимость электричества.
Всё упирается в одну цифру - объём видеопамяти (VRAM). Именно в неё загружается модель, и именно она определяет, какого «размера мозг» вы можете запустить.
Размер модели считают в миллиардах параметров (буква B: 8B, 14B, 32B). Грубое правило:
Q4_K_M - это разумный вариант по умолчанию. Модель занимает в четыре раза меньше памяти, а на глаз отвечает практически так же, как полная. Дальше все цифры я привожу именно для Q4_K_M.
Посмотреть объём своей видеопамяти можно в «Диспетчере задач» Windows на вкладке «Производительность», раздел GPU, строка «Выделенная память графического процессора».
| Видеокарта | VRAM | Что тянет (Q4_K_M) |
|---|---|---|
| RTX 4060 / 5060 | 8 ГБ | Модели до 8-12B: Qwen3 8B, Llama 3.1 8B, Gemma 3 12B (впритык) |
| RTX 4070 / 5070 | 12 ГБ | 12-14B: Gemma 3 12B, Phi-4 14B, Qwen3 14B |
| RTX 4080 / 5080 | 16 ГБ | До 32B: Qwen3 32B, Mistral Small 3 24B, Gemma 3 27B (комфортно) |
| RTX 4090 | 24 ГБ | Оптимум: Qwen3 27-32B (16-19 ГБ), DeepSeek-R1 distill 32B |
| RTX 5090 | 32 ГБ | Первая потребительская карта, тянущая 45B+ целиком на GPU; 70B в Q3 |
Даже младшая RTX 4060 на 8 ГБ уже способна нормально читать ваши документы и отвечать по ним. Для работы с текстом больше слушать умную модель, чем гнаться за самым крупным размером.
Открытых моделей много, и большинство откровенно слабые. Вот те, что реально стоят места на диске:
Под задачу «читать договоры и отвечать по ним» я бы отталкивался от Qwen3: 8B для 8 ГБ, 14B для 12 ГБ, 32B для 16-24 ГБ.
Сама модель - это файл. Чтобы он ожил, нужен движок.
ollama run qwen3. Рекомендую по умолчанию.Начните с Ollama или LM Studio. Оба ставятся за десять минут и не требуют знания программирования.
Голая модель умеет болтать, но про ваши файлы ничего не знает. Чтобы она отвечала по вашим PDF, DOCX и таблицам, нужен слой RAG - механизм, который индексирует документы и подсовывает модели нужные куски под каждый вопрос. И, что важно, делает это локально.
Три рабочих инструмента:
Все три индексируют файлы прямо на вашей машине. Документы остаются на диске, наружу не выгружается ничего.
Чтобы не тонуть в вариантах, вот конкретный набор:
Порядок такой: ставите Ollama, качаете модель одной командой, ставите AnythingLLM, скармливаете ему папку с документами, задаёте первый вопрос. На средней машине это вечер работы.
Локальный ИИ перестал быть игрушкой для инженеров. Игровая видеокарта, которую вы, может, покупали ради игр, спокойно тянет модель, читающую ваши договоры без единого запроса в облако. Данные не утекают, счёта за API нет, а на самой чувствительной задаче вы просто выдёргиваете сетевой кабель.
Начните с малого. Возьмите одну модель под свою карту, одну папку не самых секретных документов и проверьте на реальном вопросе - найдёт ли ИИ нужный пункт, не соврёт ли в цифрах. Если связка себя покажет, дальше подключите документы, которые вы бы никогда не рискнули загрузить в чужое облако. Ради этого всё и затевается.