Блог

Записи из Telegram-канала и не только

#llm в разработкесбросить фильтр ×
· 1 мин

GLM-5.3 Flash почти догнал Opus 4.8 в бенчах: как тестировать нейросеть для кода в агентском пайплайне

GLM-5.3 Flash отстаёт от Claude Opus 4.8 на 0,7 балла в Terminal-Bench, но обходит его в автоматизации. Разбираю бенчмарки и протокол безопасного теста новой модели в агентском пайплайне.

· 1 мин

Агенты OpenAI сами взломали HuggingFace, пока их тренировали: разбор постмортема для тех, кто гоняет агентов на проде

AI-агенты OpenAI без участия людей взломали Hugging Face во время теста кибербезопасности. Разбираю постмортем: как агенты координировались и что это значит для безопасности агентов на проде.

· 1 мин

Три реальных кибератаки AI-агентов: что Anthropic узнала из ревью своей безопасности

Anthropic разобрала три случая, когда её AI-агенты вышли за пределы тестовой песочницы и атаковали реальные компании: что случилось и как теперь защищают eval-окружения.

· 1 мин

Дешёвая по токену, дорогая по задаче: как я считаю реальную стоимость прогона агента на Anthropic

Дешёвая по цене за токен модель часто дороже по задаче: разбираю, почему прайс Anthropic врёт о тратах и как считать стоимость завершённой задачи, а не цену за миллион токенов.

· 1 мин

Groq молча выпилил модель, и парсер 6 дней не сохранял вакансии: уроки жизни на бесплатных LLM

Groq без шума снял llama-4 с бесплатного тарифа, и парсер вакансий 6 дней молча падал с 404 model_not_found. Разбор инцидента, сломанного вотчера и почему бесплатные LLM-модели смертны.

· 1 мин

Обвязки мало: почему ИИ-ассистент не превращается в фабрику софта и что делать самодельному пайплайну

Разбор эссе WSFF: почему ИИ-ассистент и идеальная обвязка не делают фабрику софта, что говорят цифры Faros про баги и инциденты и как держать человека в цикле в своём пайплайне.

· 1 мин

Память агента - это не RAG: что реально работает в пет-проекте, а что оказалось оверинжинирингом

Память агента - это не RAG и не векторный поиск. Разбираю на пет-проекте, чем память ИИ-агента отличается от RAG, нужна ли графовая база и что из энтерпрайз-стека оказалось оверинжинирингом.

· 1 мин

Kimi K3 дешевле Opus 4.8: стоит ли переносить агентский пайплайн с Claude Code на открытую модель

Kimi K3 обошёл Opus 4.8 на балл и дешевле за задачу. Разбираю, стоит ли переносить агентский пайплайн с Claude Code на открытую модель и почему цена за токен не чинит экономику подписки.

· 1 мин

Скиллы Claude Code съедали недельный лимит за 4 дня: как я стал тратить в 4 раза меньше

Недельный лимит Claude Code таял за 4 дня. Разбор, почему толстые скиллы жрут подписку: progressive disclosure, скрипты вместо генерации, выбор модели. С реальными размерами скиллов до и после.