Локальная модель не делает Cursor «офлайн-Pro». Редактор, индекс, Tab, облачные агенты — продукт Cursor. Ollama (LM Studio и соседи) подменяет кого вы дёргаете за токены: процесс на этой машине вместо облака провайдера.

Это не режим Hobby и не обход оплаты IDE. Свой ключ в облако — соседний контур: DeepSeek и кабинет.
Когда локальные веса имеют смысл
- Код нельзя светить даже в Privacy Mode «на всякий». Веса и инференс у вас, если вы сами так собрали контур и не отправили файл в облачный Agent.
- Ноут с нормальной видеопамятью, вы готовы ждать. 7B на CPU — это демо, не замена Agent по монорепо.
- Эксперимент: сравнить качество на одном файле с Auto.
Не имеет смысла: «чтобы было бесплатно и как Claude». Слабая локальная модель на широком @ врёт стек дешевле, но не лучше.
Чего ждать по качеству
Автодополнение и короткая правка одной функции — иногда приемлемо. Многофайловый Agent, план, рефакторинг границ модулей — обычно нет. Контекстное окно меньше, tool-calling хуже, MCP на localhost модель может не вызвать так, как облачная.
Сверяйте на одном баге: сначала Auto в Cursor, потом локальная. Если локальная проиграла — вернитесь. Не держите её дефолтом «из принципа».
Выбор облачных моделей — какой модели хватит.
Как подключать, не как ставить дистрибутив
Ollama ставите с официального сайта проекта, не из чата агента «скачай мне llm». В Cursor: Settings → Models / API, endpoint локального сервера, имя модели как в ollama list. Подписи полей менялись — смотрите свою версию.
Не кладите в git:
- бинарники весов;
- URL
127.0.0.1как «конфиг проекта» для всей команды — у коллеги другой порт; - ключ, если вдруг проксируете наружу.

Агенту не пишите «проверь, жив ли localhost:11434» вместе с .env прода. Это другой сервис.
Privacy Mode не отменяет облако, если вы параллельно жгёте Cloud Agent. Локальная модель в одном окне, облачный прогон в другом — два контура. См. Privacy.
Железо и грабли
16 ГБ RAM без видеокарты хватит на маленькую модель и не хватит на комфортный Agent. Вентилятор воет — это не «Cursor сломался», это инференс.
На Windows и Linux разные бэкенды GPU. WSL — отдельная история: WSL. Не просите агента «поставить драйвер NVIDIA».
Если Cursor не видит endpoint — сначала curl к локальному серверу из обычного терминала, потом IDE. Редактор не лечит сеть.
Когда лучше ключ в облаке, чем Ollama
Нет видеокарты. Нужен нормальный diff по десяти файлам сегодня. Команда на разных ноутах: у каждого свой «локальный Claude 70B» не воспроизводится.
DeepSeek/OpenRouter тогда дешевле нервов, чем неделя настройки весов. Локально оставляйте закрытый контур и мелкие правки.
Коротко
Ollama — свой инференс, не бесплатный Pro. Имеет смысл на закрытом коде и железе. На ежедневном Agent по рабочему репо чаще выигрывает облачная модель или ключ провайдера, не домашний сервер.
Команда и воспроизводимость
Коллега без той же карты не повторит ваш «локальный 70B». В Rules напишите «для агента используй модели из Settings проекта», не «подними Ollama как у меня». Иначе onboarding превращается в установку драйверов.
Не публикуйте порт инференса в интернет «на час». Это уже сервер с вашим кодом в промптах.
Сравнение с облачным ключом: если за вечер локальная модель трижды не попала в стек — вернитесь к кабинету провайдера. Идеология «всё только офлайн» дороже, чем кажется, когда дедлайн в пятницу.