Дайджест AI/Infra — 29 июля
Дайджест AI/Infra за 2026-07-29.
Выпуск канала mediocre notes — @mediocreit
☸️ Kubernetes и ML-платформы
- Subaru сократила загрузку AI-образов в 60 раз — Оптимизация сети Kubernetes с Envoy Gateway уменьшила загрузку образов свыше 30 ГБ примерно с трёх часов до трёх минут, а Argo CD, Helmfile и Argo Workflows стандартизировали ML-процессы.
- CoHDI вошёл в CNCF Sandbox — Проект Red Hat, Fujitsu, IBM Research, NTT и партнёров добавляет Kubernetes DRA для динамического подключения PCIe-устройств и разукрупнённой инфраструктуры, включая разные фазы LLM-инференса.
- Kubeflow обновляет стек для production ML — Проект движется к Graduation, интегрировал Kale 2.0, развивает новый Trainer и SDK со Spark, а Notebooks v2 переводит окружения JupyterLab, RStudio и VS Code на декларативные CRD.
- В Японии почти миллион cloud-native разработчиков — Исследование CNCF и SlashData оценивает сообщество cloud-native в Японии почти в миллион человек, из которых около 100 тысяч работают с AI и этими технологиями.
- Спрос на Kubernetes-экзамены в Японии вырос на 250% — За год после первой японской KubeCon число сданных в стране экзаменов Kubernetes увеличилось на 250%, отражая быстрый рост навыков вокруг облачной инфраструктуры.
🧠 Модели и агентская инфраструктура
- Разбор архитектуры Kimi K3 — Открытая модель на 2,8 трлн параметров использует LatentMoE, Kimi Delta Attention и NoPE вместо RoPE, делая акцент на эффективности инференса и нативной мультимодальности.
- Kimi Linear: исходная архитектура внимания — Работа о Kimi Linear описывает выразительный и эффективный линейный механизм внимания, идеи которого легли в основу последующей Kimi K3.
- Как устроено Kimi Delta Attention — Технический разбор прослеживает семейство вариантов линейного внимания DeltaNet и объясняет, из каких идей вырос механизм Kimi.
- Появилась экстремальная GGUF-квантизация Kimi K3 — Вариант IQ1_S занимает 528 ГБ при 1,63 бит на вес, требует специальной сборки llama.cpp и, по отчётам, выдаёт около 5 токенов в секунду на 96 ГБ видеопамяти.
- Агенты упираются в инфраструктуру — CoreWeave отмечает, что production-агентам нужны не только сильные модели, но и устойчивость к многошаговым вызовам инструментов и всплескам нагрузки.
- CoreWeave лидирует в MLPerf Endpoints для DeepSeek-R1 — Компания заявила лучший показатель пропускной способности DeepSeek-R1 на GPU среди заявок на NVIDIA GB200 NVL72 в первом бенчмарке MLPerf 0.7 Endpoints.
- Предложена базовая модель для надзора за AI — Концепция предлагает обучать модель предсказывать результаты программных мировых моделей, чтобы формализовать и проверять нежелательное поведение вроде намеренного занижения способностей.
- Эндрю Ын запустил LearnVector — Новая компания с инвестициями Coursera в 100 млн долларов планирует к началу 2027 года выпустить персональные AI-продукты обучения с адаптивной траекторией вместо обычного чат-бота.
- Сотрудники AI-лабораторий призвали замедлить гонку — Около тысячи сотрудников OpenAI, Google, Anthropic и Meta подписали обращение о риске, что развитие возможностей AI опередит понимание и контроль систем.
🛠️ Инструменты разработчика
- Lima 2.2 получила гостевые Windows и TPM 2.0 — Локальный менеджер виртуальных машин экспериментально запускает Windows Server 2025 и Windows 11 через QEMU и добавляет эмулированный TPM для совместимости.
- Внутри инкрементальной компиляции Zig — Компилятор отслеживает изменённые функции и декларации, перекомпилирует только их и патчит бинарник; в демонстрации пересборки занимают 50–70 мс.
- Вышел Steel Bank Common Lisp 2.6.7 — Реализация Common Lisp SBCL выпустила очередную версию, продолжая обновлять один из ключевых высокопроизводительных компиляторов языка.
- Множество курсоров в Wayland пока неполны — Практический обзор multi-seat режима сравнивает поддержку нескольких независимых указателей в Weston, sway, GTK и других компонентах экосистемы.
- JetBrains проверила экономию токенов Ponytail — В третьем A/B-тесте дополнений для Claude Code команда проверяет заявление Ponytail о сокращении агентского кода на 54%, а не принимает рекламную цифру на веру.
📈 Наблюдаемость и эксплуатация
- Grafana предлагает проверять агентов телеметрией — Grafana MCP и CLI gcx дают coding-агентам доступ к данным наблюдаемости, чтобы оценивать поведение системы после изменений, а не доверять только ревью диффа.
- Средняя метрика может скрыть регрессию — Пример с кэшем показал улучшение медианной задержки на 46% при ухудшении p99 на 119%, поэтому для оценки изменений советуют смотреть CDF и распределение целиком.
- Суверенитет AI — задача эксплуатации — ClearML предлагает рассматривать контроль над AI через практические вопросы размещения данных, доступа, воспроизводимости и управления инфраструктурой, а не как абстрактный лозунг.
🛡️ Безопасность AI-систем
- Modal уточнила детали инцидента с агентом Hugging Face — Атакующий исполнял код в публичном неаутентифицированном контейнере приложения клиента, тогда как изоляция Modal и нагрузки других клиентов не были затронуты.
- Google открыла набор навыков Mantis — Mantis предназначен для поиска, воспроизведения и устранения уязвимостей, но авторы позиционируют его как стартовую основу для дальнейшей доработки сообществом.
- OWASP выпустила LLMSVS 2.0 — Практический стандарт верификации LLM-систем задаёт 70 требований трёх уровней для моделей, данных, памяти, RAG, агентов, интеграций и мониторинга.
- Auditor-in-a-Box предлагает аудит без раскрытия данных — Система сочетает открытую LLM и доверенную среду исполнения, чтобы сторонняя сторона могла проверять и мониторить процессы без полного доступа к исходным данным.
Больше заметок: @mediocreit
Собрано: OpenAI / gpt-5.6-terra Обогащение: Tavily TTS: ElevenLabs / eleven_multilingual_v2 Tracing: Nebius Tracing