Локальная LLM в Cursor: Ollama и когда свой сервер хуже ключа

Железо, качество, нет магии облака. Когда Ollama уместна, когда лучше DeepSeek в кабинете.

Вернуться в гайды

Локальная модель не делает Cursor «офлайн-Pro». Редактор, индекс, Tab, облачные агенты — продукт Cursor. Ollama (LM Studio и соседи) подменяет кого вы дёргаете за токены: процесс на этой машине вместо облака провайдера.

Локальная LLM в Cursor: Ollama и когда свой сервер хуже ключа

Это не режим Hobby и не обход оплаты IDE. Свой ключ в облако — соседний контур: DeepSeek и кабинет.

Когда локальные веса имеют смысл

  • Код нельзя светить даже в Privacy Mode «на всякий». Веса и инференс у вас, если вы сами так собрали контур и не отправили файл в облачный Agent.
  • Ноут с нормальной видеопамятью, вы готовы ждать. 7B на CPU — это демо, не замена Agent по монорепо.
  • Эксперимент: сравнить качество на одном файле с Auto.

Не имеет смысла: «чтобы было бесплатно и как Claude». Слабая локальная модель на широком @ врёт стек дешевле, но не лучше.

Чего ждать по качеству

Автодополнение и короткая правка одной функции — иногда приемлемо. Многофайловый Agent, план, рефакторинг границ модулей — обычно нет. Контекстное окно меньше, tool-calling хуже, MCP на localhost модель может не вызвать так, как облачная.

Сверяйте на одном баге: сначала Auto в Cursor, потом локальная. Если локальная проиграла — вернитесь. Не держите её дефолтом «из принципа».

Выбор облачных моделей — какой модели хватит.

Как подключать, не как ставить дистрибутив

Ollama ставите с официального сайта проекта, не из чата агента «скачай мне llm». В Cursor: Settings → Models / API, endpoint локального сервера, имя модели как в ollama list. Подписи полей менялись — смотрите свою версию.

Не кладите в git:

  • бинарники весов;
  • URL 127.0.0.1 как «конфиг проекта» для всей команды — у коллеги другой порт;
  • ключ, если вдруг проксируете наружу.

Локальная LLM в Cursor: Ollama и когда свой сервер хуже ключа

Агенту не пишите «проверь, жив ли localhost:11434» вместе с .env прода. Это другой сервис.

Privacy Mode не отменяет облако, если вы параллельно жгёте Cloud Agent. Локальная модель в одном окне, облачный прогон в другом — два контура. См. Privacy.

Железо и грабли

16 ГБ RAM без видеокарты хватит на маленькую модель и не хватит на комфортный Agent. Вентилятор воет — это не «Cursor сломался», это инференс.

На Windows и Linux разные бэкенды GPU. WSL — отдельная история: WSL. Не просите агента «поставить драйвер NVIDIA».

Если Cursor не видит endpoint — сначала curl к локальному серверу из обычного терминала, потом IDE. Редактор не лечит сеть.

Когда лучше ключ в облаке, чем Ollama

Нет видеокарты. Нужен нормальный diff по десяти файлам сегодня. Команда на разных ноутах: у каждого свой «локальный Claude 70B» не воспроизводится.

DeepSeek/OpenRouter тогда дешевле нервов, чем неделя настройки весов. Локально оставляйте закрытый контур и мелкие правки.

Коротко

Ollama — свой инференс, не бесплатный Pro. Имеет смысл на закрытом коде и железе. На ежедневном Agent по рабочему репо чаще выигрывает облачная модель или ключ провайдера, не домашний сервер.

Команда и воспроизводимость

Коллега без той же карты не повторит ваш «локальный 70B». В Rules напишите «для агента используй модели из Settings проекта», не «подними Ollama как у меня». Иначе onboarding превращается в установку драйверов.

Не публикуйте порт инференса в интернет «на час». Это уже сервер с вашим кодом в промптах.

Сравнение с облачным ключом: если за вечер локальная модель трижды не попала в стек — вернитесь к кабинету провайдера. Идеология «всё только офлайн» дороже, чем кажется, когда дедлайн в пятницу.

Мы используем файлы cookie для того, чтобы предоставить пользователям больше возможностей при посещении сайта. Оставаясь на сайте, Вы соглашаетесь на обработку файлов cookie. Подробнее об условиях использования.