Дайджест AI/Infra — 9 июля
Дайджест AI/Infra за 2026-07-09.
Выпуск канала mediocre notes — @mediocreit
🧠 AI-модели и голосовые интерфейсы
- xAI представила Grok 4.5 — модель для кодинга и агентных задач — Grok 4.5 обучен совместно с Cursor на десятках тысяч NVIDIA GB300, показывает 62% на DeepSWE 1.0, 29% на SWE Marathon и доступен по $2/$6 за миллион токенов.
- OpenAI запустила GPT-Live — full-duplex голосовую модель — GPT-Live умеет слушать и говорить одновременно, делегирует сложные задачи GPT-5.5 в фоне и уже доступна в ChatGPT в двух версиях.
- Июльские релизы: DeepSeek V4 Pro, GPT-5.6 и ожидание Gemini 3.5 Pro — DeepSeek V4 Pro официально выходит в середине июля с пиковым ценообразованием (x2 в рабочие часы Пекина), GPT-5.6 с моделью Sol — на следующий день после GPT-Live, Gemini 3.5 Pro перенесён с июня.
- Qwopus3.6-35B-A3B-Coder: агентная модель для локального кодинга без режима размышлений — Тонкая настройка Qwen3.6 MoE (35B всего / ~3B активных) показывает 62.4% на SWE-bench в режиме thinking-off, оптимизирована для локальных tool-calling воркфлоу.
🦀 Bun переезжает на Rust
- Bun переписан с Zig на Rust: причины и процесс — Джарред Самнер перевёл Bun на Rust из-за уязвимостей памяти при смешивании GC и ручного управления; переписывание заняло ~11 дней с помощью Claude Code Fable 5 и dynamic workflows.
- Как один разработчик переписал Bun с помощью Claude Code — Самнер в одиночку использовал Claude Code workflows с adversarial-ревью и параллельными сабагентами; задача, которая заняла бы команду год, была выполнена примерно за 11 дней.
🏗️ Инфраструктура и распределённые системы
- Cloudflare Meerkat: глобальный консенсус без лидера на QuePaxa — Cloudflare строит консенсус-сервис Meerkat на алгоритме QuePaxa, где все реплики могут писать одновременно без таймаутов — первое промышленное внедрение для 330+ дата-центров.
- Modal объясняет экономику serverless GPU — При peak-to-average выше 5:1–10:1 (инференс, тренировка, агенты) serverless GPU на Modal дешевле резерваций, несмотря на более высокую базовую ставку.
- CNCF опубликовала white paper по хранению данных для Cloud Native AI — Документ описывает вызовы при развёртывании data-heavy AI/ML-нагрузок на cloud native инфраструктуре.
- Cloudflare Drop: мгновенный хостинг статических сайтов — Загрузка папки или ZIP с HTML/CSS/JS — и сайт доступен instantly.
🛠️ DevTools и агентный кодинг
- JetBrains выпустила Kotlin Benchmark для AI-агентов — Бенчмарк на 105 задач из реальных open-source Kotlin-проектов: Claude Code с Opus 4.7 xhigh лидирует с 85.71% resolved на первом запуске.
- Dash0 AI Coding Insights: связь токенов и ценности от агентов — Инструмент показывает посессионную и покомандную отдачу от Claude Code и Cursor, помогая понять, какие сессии приносят реальный результат, а какие — лишь жгут токены.
- Network boundary для AI-агентов через NGINX и OpenTelemetry — Паттерн создания сетевого периметра для агентов с помощью NGINX и наблюдаемости через OpenTelemetry.
- От REST к MCP: LLM и новое проектирование API — часть 2 — Дмитрий Бондарев из Авито продолжает разбор того, как LLM меняют принципы проектирования API при работе с агентами.
🔧 Инференс, Bazel и базы данных
- Яндекс: оптимизация инференса LLM — кеширование, latency, GPU — Проблемы TTFT часто вызваны не моделью, а планировщиком; статья разбирает практические приёмы оптимизации.
- Bazel Q2 2026 Community Update — BazelCon 2026 пройдёт 13–15 октября в Амстердаме, плюс традиционный отчёт о состоянии сообщества.
- Yandex Cloud: как выбрать конфигурацию кластера PostgreSQL — Практическое руководство по осознанному выбору конфигурации для отказоустойчивых и производительных кластеров.
🔬 Исследования и безопасность AI
- Anthropic GRAM: модульное дообучение для контроля опасных знаний — Метод Gradient Routed Auxiliary Modules позволяет «включать» и «выключать» изолированные возможности модели без тренировки нескольких версий.
- Subliminal learning работает на любом LoRA-ранге при правильном LR — Сублиминальное обучение проявляется при любом ранге LoRA и полном файнтюнинге, если подобрать learning rate под ранг и дать достаточно данных.
- Исследователь: safety-фильтры Fable от Anthropic слишком агрессивны — Роб Патро жалуется, что Fable блокирует безобидные запросы о разработке ПО и биологии, плюс модель недоступна из-за экспортных ограничений.
- Китай утвердил правила безопасности для AI-агентов (TC260) — Документ TC260 охватывает весь жизненный цикл агентов: запрет решений без поддержки дольше месяца, с критическими уязвимостями и без журналирования.
- Уязвимость Januscape (CVE-2026-53359) — побег из KVM-виртуализации — Yandex Cloud подтверждает, что их сервисы не затронуты; облачным провайдерам на KVM рекомендуются отключение nested virtualization и мониторинг попыток эксплуатации.
- Подробности Januscape и компенсирующие меры для облаков на KVM — Рекомендации: отключить nested virtualization, внедрить правила детектирования попыток эксплуатации до установки патча.
💰 Экономика AI-разработки
- Реальная стоимость AI-агентов: $500M счета, увольнения и гонка токенов — Uber потратил годовой AI-бюджет за 4 месяца, одна компания получила счёт на $500M за Claude Code, а в Nvidia траты на compute превысили затраты на инженеров.
Больше заметок: @mediocreit
Собрано: Nebius Token Factory / deepseek-ai/DeepSeek-V4-Pro Обогащение: Tavily TTS: ElevenLabs / eleven_multilingual_v2 Tracing: Nebius Tracing