Дайджест AI/Infra — 7 июля
Дайджест AI/Infra за 2026-07-07.
Выпуск канала mediocre notes — @mediocreit
🧠 Интерпретируемость и внутреннее устройство LLM
- Anthropic обнаружила в Claude «глобальное рабочее пространство» (J-space) — Исследователи Anthropic нашли в Claude небольшую группу нейронных паттернов, аналогичную «сознательному мышлению» человека: модель использует J-space для внутренних рассуждений, может описывать и модулировать эти представления, а подавление J-space лишает её высших когнитивных функций.
- Обзор J-space: рабочий инструмент для интерпретируемости — Рецензия на статью Anthropic подтверждает, что J-space — это убедительная «когнитивная рабочая память» модели, а метод J-Lens полезен для аудита alignment, но не покрывает всю автоматическую активность модели.
- Фильтрация данных не удаляет нежелательное поведение LLM — Исследование на LessWrong показывает: фильтрация обучающих данных почти не помогает избавиться от вредных черт модели, поскольку поведение не столько «преподаётся», сколько elicits — пробуждается — а единственное исключение — refusal.
🤖 AI-агенты и инструменты разработки
- Dash0 запускает Darkplane — контроль качества AI-кода от PR до продакшена — Платформа отслеживает стоимость AI-написанных изменений, их поведение в production и автоматически мёржит безопасные PR; проект вышел на фоне роста инцидентов на 243% в командах, активно использующих AI.
- Dash0: от observability к замкнутому циклу AI-разработки — Компания объединила OpenTelemetry-платформу SignalStore, агентную AI-систему Agent0 и инструмент Darkplane в сквозной конвейер: AI пишет код — платформа проверяет его в production без участия человека.
- Caveman-скилл экономит лишь 8.5% токенов, а не 65% — тест JetBrains — Бенчмарк SkillsBench на Claude Code показал: сжатие «caveman mode» касается только нарратива между вызовами инструментов, а код и диффы остаются нетронутыми; качество выполнения задач не страдает.
☁️ Платформенная инженерия и облачная инфраструктура
- Cloudflare Workers Cache: кэш перед воркером одной строкой конфига — Tiered-кэш работает на всех точках сети Cloudflare, управляется через Cache-Control-заголовки и не требует отдельных зон — при попадании в кэш воркер не исполняется и не тарифицируется.
- CNCF: Platform Engineering 2.0 для AI-нагрузок — Платформам нужны нативные GPU/TPU, MCP-шлюзы, FinOps и multi-persona опыт, чтобы обслуживать не только разработчиков, но и ML-инженеров, дата-сайентистов и AI-агентов.
- CoreWeave — «визионер» в Gartner Magic Quadrant Cloud AI Infrastructure 2026 — Провайдер GPU-облака для AI-нагрузок отмечен Gartner за инновации и способность масштабировать AI-инфраструктуру.
- Яндекс Облако: S3 Intelligent Tiering, Master Autoscaler в K8s и MCP-серверы в Marketplace — Июньский дайджест включает автотиринг в Object Storage с экономией до 61%, Kubernetes Master Autoscaler, снижение цен на BareMetal до 38% и категорию MCP-серверов в Cloud Marketplace.
⚡ ML-модели и бенчмарки
- GigaChat 3.5 Ultra: 432B-параметров, FP8-обучение и online RL — Модель Сбера полностью обучена в FP8, получила две MTP-головы для ускорения генерации до 2.2× и по бенчмаркам сопоставима с DeepSeek V3.2 при меньшем размере; код и веса под MIT.
- Qwopus3.6-27B: ресерчерский превью на базе Qwen3.6 — Ранняя reasoning-модель дообучена на ~12K curated-примерах для улучшения структурированного мышления и консистентности ответов; доступна в GGUF.
- Ternlight: 7 МБ эмбеддинг-модель в браузере через WASM — Полностью клиентская sentence-embedding модель выполняет семантический поиск по документации React без сетевых запросов после первой загрузки.
- Цена за миллион токенов — бессмысленная метрика — Из-за разной токенизации и token efficiency сравнение по $/1M токенов вводит в заблуждение; стоимость одной задачи показывает, что DeepSeek V4 Pro дешевле GPT-5.5, несмотря на более высокую токен-цену.
🔬 GPU-вычисления и высокие нагрузки
- Проект ШАДа — в Spotlight ICML 2026: IO-aware GPU-ядра для графовых нейросетей — Яндекс Research показал три семейства специализированных кернелов, решающих проблему нерегулярного доступа к памяти в GNN — работа вошла в 2.2% лучших заявок конференции.
- AMD Ryzen AI Halo — dev-кит за $4000 для локального AI — LTT Labs оценили новый AI-девелоперский kit от AMD с мощным NPU; устройство ориентировано на тех, кто хочет обучать и запускать модели локально без облачных GPU.
- Ozon Tech: доставка 10 ГБ данных в память 500 подов при 600k RPS — Эволюция от полной периодической выгрузки к снапшотам в S3 и дельте из PostgreSQL для сервиса выбора склада с SLA 50 мс на 600 000 RPS.
🛠️ Dev-инструменты и языки
- Road to Elm 1.0: ускорение сборки и будущее языка — Большой апдейт от разработчиков Elm — анонс пути к версии 1.0 с фокусом на кардинальное ускорение компиляции.
- Natvis для C++ приходит в Linux и macOS в Rider 2026.2 — JetBrains переносит нативную визуализацию C++-типов в отладчике на Linux и macOS без необходимости писать кастомные data formatter.
- Java Digest #37: JDK 27, Spring Boot 4.1 и Hibernate 8.0 — Свежий дайджест от Java-команды Т-Банка с новостями о грядущих версиях JDK, Spring Boot и Hibernate.
📡 Железо, опенсорс и вокруг IT
- OpenWrt One — открытый аппаратный роутер — Проект OpenWrt представил собственный роутер с открытыми спецификациями, готовый к кастомным прошивкам и поддерживаемый сообществом.
- CoMaps — свободные офлайн-карты — FOSS-приложение для навигации без интернета набирает популярность на Hacker News.
- Google проиграл апелляцию: штраф €4.12 млрд от ЕС подтверждён — Высшая инстанция ЕС оставила в силе рекордный антимонопольный штраф за обязательную предустановку Search и Chrome на Android — кейс тянется с 2018 года.
Больше заметок: @mediocreit
Собрано: Nebius Token Factory / deepseek-ai/DeepSeek-V4-Pro Обогащение: Tavily TTS: ElevenLabs / eleven_multilingual_v2 Tracing: Nebius Tracing