<?xml version='1.0' encoding='UTF-8'?><?xml-stylesheet href="http://www.blogger.com/styles/atom.css" type="text/css"?><feed xmlns='http://www.w3.org/2005/Atom' xmlns:openSearch='http://a9.com/-/spec/opensearchrss/1.0/' xmlns:blogger='http://schemas.google.com/blogger/2008' xmlns:georss='http://www.georss.org/georss' xmlns:gd="http://schemas.google.com/g/2005" xmlns:thr='http://purl.org/syndication/thread/1.0'><id>tag:blogger.com,1999:blog-21489562</id><updated>2026-09-17T16:55:49.477+03:00</updated><category term="техническое"/><category term="big data"/><category term="ссылки"/><category term="Креатив"/><category term="Чтиво"/><category term="сервисы"/><category term="Жизнь"/><category term="Архитектура"/><category term="mashup"/><category term="Стартап"/><category term="Projects"/><category term="Google"/><category term="кибербезопасность"/><category term="Open Source"/><category term="Mobile 2.0"/><category term="курсы"/><category term="Java"/><category term="Проекты"/><category term="дизайн"/><category term="Web 2.0"/><category term="Android"/><category term="BLE"/><category term="Абавазрение"/><category term="слухи"/><category term="VOIP"/><category term="SIP"/><category term="Подкасты"/><category term="Asterisk"/><category term="работа"/><category term="Skype"/><category term="VXML"/><category term="интервью"/><category term="RSS"/><category term="Web 3.0"/><category term="safety"/><title type='text'>AbavaNet technical corner</title><subtitle type='html'>технические проблемы и идеи, родившиеся в бурных водах реки Abava (а равно как и на ее берегах, далеких и близких), выставленные на всеобщее обсуждение</subtitle><link rel='http://schemas.google.com/g/2005#feed' type='application/atom+xml' href='https://abava.blogspot.com/feeds/posts/default'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default?alt=atom'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/'/><link rel='hub' href='http://pubsubhubbub.appspot.com/'/><link rel='next' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default?alt=atom&amp;start-index=26&amp;max-results=25'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><generator version='7.00' uri='http://www.blogger.com'>Blogger</generator><openSearch:totalResults>11294</openSearch:totalResults><openSearch:startIndex>1</openSearch:startIndex><openSearch:itemsPerPage>25</openSearch:itemsPerPage><entry><id>tag:blogger.com,1999:blog-21489562.post-235433319378833401</id><published>2026-09-17T15:06:00.000+03:00</published><updated>2026-09-17T15:06:00.165+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>О безопасности VLM</title><content type='html'>&lt;a href=&quot;https://ptfux.tech/research/vlm#%D1%87%D1%82%D0%BE-%D1%82%D0%B0%D0%BA%D0%BE%D0%B5-vlm&quot; target=&quot;_blank&quot;&gt;Хорошее описание от Яндекс&lt;/a&gt;

&lt;p&gt;См. также другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=mllm&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;MLLM&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/235433319378833401/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/235433319378833401' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/235433319378833401'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/235433319378833401'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/vlm.html' title='О безопасности VLM'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-6962417979398252889</id><published>2026-09-16T11:16:00.000+03:00</published><updated>2026-09-16T11:16:00.110+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>О безопасности мультиагентных систем</title><content type='html'>В мультиагентных приложениях на базе LLM цепочка компонентов включает планировщик, агентов-исполнителей, верификатор и синтезатор; при этом каждый канал передачи данных между агентами остается неконтролируемым, что позволяет злоумышленнику внедрять вредоносные инструкции. Существующие средства защиты либо контролируют только входной интерфейс (IBProtector, Llama Guard, фильтры перплексии, SmoothLLM), либо работают вне приложения как непрозрачные стохастические фильтры контента на стороне провайдера. Мы показываем, что этот пробел влечет за собой последствия, которые редко учитываются на практике: в ходе оценки по 2100 сценариям (охватывающим восемь семейств атак, пять методов защиты и три базовые модели) выяснилось, что конвейер без специальной защиты, демонстрирующий полную безопасность согласно стандартным метрикам (нулевой уровень успеха атак типа «отравление инструментов» и «отравление памяти»), обязан этой безопасностью почти исключительно серверному фильтру облачного провайдера (54 из 60 блокировок в Azure GPT-5); при запуске на платформе без такого фильтра защита обеспечивается исключительно за счет механизмов согласования (alignment) самой модели-агента. Отчетность, учитывающая лишь конечный результат, скрывает эту зависимость. Мы представляем ChannelGuard — систему эшелонированной защиты, не требующую дообучения моделей и использующую шлюзы на основе принципа информационного «узкого места» (IB) для каждого канала связи между агентами. Каждый шлюз оценивает текст в канале, сравнивая его с базой данных вредоносных фраз (на основе сходства эмбеддингов предложений), и детерминированно пропускает, сжимает или блокирует сообщение, не прибегая к дополнительным вызовам LLM; при этом метод атрибуции фиксирует, на каком именно уровне была впервые остановлена атака. Шлюз ChannelGuard, контролирующий выходные данные инструментов, блокирует все 30 из 30 попыток «отравления инструментов» на уровне приложения, причем эффективность остается неизменной для моделей Azure GPT-5, Anthropic Sonnet 4.5 и Anthropic Haiku 4.5 (тогда как механизмы защиты в незащищенном конвейере существенно различаются в зависимости от используемой модели). Кроме того, ChannelGuard снижает вероятность успеха атак типа «инъекция промпта» на 50% (с 0,333 до 0,167) и сохраняет точность решения задач GSM8K на прежнем уровне (0,867). Мы также четко обозначаем ограничения метода: адаптивное перефразирование в условиях «белого ящика» позволяет обойти любой шлюз, основанный на эмбеддингах, — в таких случаях более эффективным оказывается базовый метод, использующий возмущение входных данных и голосование (perturb-and-vote). В расширенном приложении представлены четыре базовых решения, результаты абляционных исследований, данные перебора гиперпараметров, анализ сохранения безопасных примеров, а также аудит оценок, выполненный судьями из разных семейств моделей (𝜅=0,900); общие затраты составили 47,36 доллара. - &lt;a href=&quot;https://arxiv.org/pdf/2607.19430&quot; target=&quot;_blank&quot;&gt;ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems&lt;/a&gt;

&lt;p&gt;См. также другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=agents&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;агентам&lt;/a&gt;
</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/6962417979398252889/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/6962417979398252889' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/6962417979398252889'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/6962417979398252889'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/blog-post_16.html' title='О безопасности мультиагентных систем'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-5723634078940345055</id><published>2026-09-15T10:36:00.000+03:00</published><updated>2026-09-15T10:36:00.109+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>О защите мультимодальных моделей</title><content type='html'>Мультимодальные большие языковые модели (MLLM) продемонстрировали впечатляющие возможности в широком спектре генеративных задач. Однако внедрение нетекстовых модальностей создает серьезные проблемы для обеспечения безопасности (alignment). MLLM часто отклоняют небезопасные текстовые запросы, но при этом выдают вредные ответы на семантически эквивалентные мультимодальные входные данные. Существующие стратегии защиты, включая внешние фильтры (guardrails) и дообучение с упором на безопасность, по большей части упускают из виду механизмы, лежащие в основе этого дисбаланса. Внешние фильтры лишь обходят внутренние недостатки модели, а дообучение рассматривает задачу согласования как оптимизацию «черного ящика», не выявляя и не устраняя конкретный изъян. В результате эти методы либо приводят к значительным задержкам при генерации (инференсе) при ограниченной защите, либо существенно снижают полезность модели и требуют огромных объемов мультимодальных данных. Таким образом, обеспечение эффективной и сохраняющей полезность защиты MLLM остается нерешенной задачей. В данной работе мы проводим геометрический анализ представлений MLLM, чтобы выяснить причины снижения уровня безопасности в мультимодальном режиме. Мы обнаружили, что механизмы безопасности, сформированные в чисто текстовой модальности, сохраняются и в мультимодальной среде. Подпространство безопасности с границей отказа остается актуальным для различных модальностей: представления, попадающие внутрь этой границы, неизменно вызывают безопасный отказ от выполнения запроса. Однако мы наблюдаем критический сдвиг в представлениях, из-за которого большинство небезопасных мультимодальных входных данных оказываются за пределами границы и обходят этот внутренний механизм. Это открытие позволяет определить, что первопричиной сбоев в системе безопасности при работе с мультимодальными данными является именно сдвиг представлений, а не отсутствие у модели соответствующих возможностей. Опираясь на это наблюдение, мы предлагаем MMAligner — метод защиты MLLM, основанный на калибровке представлений. В отличие от существующих подходов, MMAligner устраняет этот сдвиг, оптимизируя модель так, чтобы она отображала небезопасные мультимодальные представления внутрь уже существующей границы отказа. В частности, метод использует жесткую нижнюю границу для гарантии отказа и мягкую верхнюю границу для предотвращения чрезмерных изменений, сохраняя при этом представления для безопасных (корректных) входных данных. Обширные эксперименты с использованием различных MLLM с открытым исходным кодом показывают, что MMAligner повышает средний уровень отказа при обработке небезопасных мультимодальных данных до 99%, снижая полезность модели менее чем на 2% и требуя минимального объема данных; это значительно превосходит показатели существующих базовых методов с точки зрения баланса между безопасностью и полезностью. - &lt;a href=&quot;https://arxiv.org/pdf/2608.05909&quot; target=&quot;_blank&quot;&gt;MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration&lt;/a&gt;

&lt;p&gt;См. также другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=mllm&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;MLLM&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/5723634078940345055/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/5723634078940345055' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/5723634078940345055'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/5723634078940345055'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/blog-post_15.html' title='О защите мультимодальных моделей'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-6105721186457774659</id><published>2026-09-14T10:27:44.667+03:00</published><updated>2026-09-14T10:27:44.667+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Пентестинг для ИИ-агентов</title><content type='html'>В традиционном тестировании на проникновение (пентестинге) на каждом этапе применяется разведка для выявления скрытых уязвимостей, подготовки более эффективных атак и продвижения к цели; мы утверждаем, что к ИИ-агентам следует применять аналогичный подход. Мы формализуем процесс разведки агентов, моделируя его и определяя информационные активы, которые пытается извлечь злоумышленник: что они собой представляют, как используются и какие уязвимости агента эксплуатируют, предоставляя атакующему преимущество при проведении атак типа «непрямая инъекция промпта» (indirect prompt injection). Эти идеи реализованы в KYA (Know Your Agent) — фреймворке, автоматизирующем тестирование на проникновение методом «черного ящика» с опорой на разведку; система зондирует агентов, формирует профили целей и использует их для создания более мощных атак. Мы оцениваем эффективность KYA с помощью специализированных наборов тестов (бенчмарков) и на примере реального агента для написания кода, а также публикуем сам фреймворк, бенчмарки и базовые реализации для обеспечения воспроизводимости результатов. - &lt;a href=&quot;https://arxiv.org/pdf/2607.19837&quot; target=&quot;_blank&quot;&gt;Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents&lt;/a&gt;

&lt;p&gt;См. также другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=agents&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;агентам&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/6105721186457774659/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/6105721186457774659' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/6105721186457774659'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/6105721186457774659'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/blog-post_14.html' title='Пентестинг для ИИ-агентов'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-3718430377832528624</id><published>2026-09-13T14:01:56.102+03:00</published><updated>2026-09-13T14:01:56.103+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="Архитектура"/><title type='text'>К проектированию ИИ-агентов</title><content type='html'>Код с пояснениями для программирования ИИ-агентов

&lt;p&gt;&lt;a href=&quot;https://github.com/tttzof351/agent_from_scratch&quot; target=&quot;_blank&quot;&gt;LLM-агент с нуля. Учебный проект на Python&lt;/a&gt;
  
&lt;p&gt;&lt;a href=&quot;https://pub.towardsai.net/enterprise-agentic-ai-architecture-from-llm-to-production-grade-autonomous-agents-e986eeba8bce&quot; target=&quot;_blank&quot;&gt;Enterprise Agentic AI Architecture: From LLM to Production-Grade Autonomous Agents&lt;/a&gt;

&lt;p&gt;См. также другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=agents&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;агентам&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/3718430377832528624/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/3718430377832528624' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/3718430377832528624'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/3718430377832528624'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/blog-post_13.html' title='К проектированию ИИ-агентов'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-1772820487272247831</id><published>2026-09-12T12:26:00.000+03:00</published><updated>2026-09-12T12:26:00.113+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>ИИ атакует</title><content type='html'>&lt;a href=&quot;https://www.itweek.ru/security/article/detail.php?ID=235444&amp;amp;newspp=1&amp;amp;newsid=10192&quot; target=&quot;_blank&quot;&gt;Когда атакует машина: как генеративный ИИ переписал правила кибервойны&lt;/a&gt;
&lt;p&gt;
За тридцать лет индустрия информационной безопасности пережила несколько технологических сдвигов, но ни один из них не менял расстановку сил так быстро, как генеративный ИИ. Раньше между появлением нового класса атак и его массовым применением проходили годы: злоумышленникам нужно было время, квалификация и инфраструктура. Сегодня этот барьер обрушился. Написать фишинговое письмо на безупречном русском, собрать досье на жертву, сгенерировать вариант вредоносного кода, обходящий сигнатурный детектор — всё это стало доступно человеку без глубокой технической подготовки и занимает минуты, а не недели. Рассмотрим, как эволюционировали методы кибератак с появлением ИИ.</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/1772820487272247831/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/1772820487272247831' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/1772820487272247831'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/1772820487272247831'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/blog-post_12.html' title='ИИ атакует'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-7141842493183943873</id><published>2026-09-11T11:03:00.000+03:00</published><updated>2026-09-11T11:03:00.110+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Бэкдоры в ИИ-агентах</title><content type='html'>Агенты LLM с открытыми весами уязвимы для бэкдоров, установленных во время тонкой настройки, которые могут быть необнаружимы, если условия срабатывания никогда не выполняются во время тестирования. Предполагая, что защитники не знают существующего триггера, они не могут напрямую отменить его. Одна из стратегий дезактивации заключается в установке известного бэкдора (защитное отравление), а затем в его отмене, в надежде, что исходный неизвестный бэкдор будет удален в качестве побочного эффекта. Однако эта процедура имеет неопределенные результаты: исходный бэкдор может сохраниться, быть стерт или перенаправлен, среди прочих возможностей. Мы представляем структуру для изучения этой динамики в агентах, вызывающих инструменты, разделяя триггер, реакцию, учителя и метод тонкой настройки в ходе систематических экспериментов на AgentDyn. В 115 экспериментах только защитное отравление стирает ~56% исходных бэкдоров; последующая дезактивация затем приводит к удалению почти всех выживших, подтверждая, что распознавание триггера и вредоносное выполнение поведенчески различимы. Интересно, что наши эксперименты показывают, что вредоносные бэкдоры никогда не сохраняются при использовании различных триггеров того же общего типа, что и защитный бэкдор, после чего следует дезактивация путем разучивания. Совместная установка до четырех бэкдоров повышает устойчивость (удалено ~36%), однако дезактивация одного известного совместного бэкдора приводит к удалению 52 из 60 совместно содержащихся бэкдоров (87%). При визуализации внутренних структур модели после дезактивации с помощью J-линз мы подтверждаем, что, хотя дезактивация восстанавливает доброкачественные реакции LLM,
следы первоначального осознания триггера сохраняются на промежуточных уровнях. - &lt;a href=&quot;https://arxiv.org/pdf/2608.11295&quot; target=&quot;_blank&quot;&gt;Backdoor Decontamination Dynamics in LLM Agents&lt;/a&gt;

&lt;p&gt;См. также другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=agents&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;агентам&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/7141842493183943873/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/7141842493183943873' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/7141842493183943873'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/7141842493183943873'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/blog-post_11.html' title='Бэкдоры в ИИ-агентах'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-3569935505178891363</id><published>2026-09-10T10:00:00.000+03:00</published><updated>2026-09-10T10:00:00.114+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Уязвимости в связке LLM и веб-приложений</title><content type='html'>Большие языковые модели все чаще интегрируются в веб-приложения посредством чат-ботов, конвейеров вызова инструментов и агентных рабочих процессов. В
этих системах пользовательский ввод может влиять не только на генерируемый текст, но и на действия бэкэнда, такие как запросы к базе данных, HTTP-запросы, операции с файлами, рендеринг шаблонов или вызовы API. В этой статье представлены веб-атаки с использованием больших языковых моделей (LLM), класс атак, при которых контролируемый злоумышленником ввод преобразуется интегрированным в LLM приложением, а затем достигает традиционных приемников веб-приложений. Мы систематизируем эту поверхность атаки с помощью репрезентативных вариантов LLM2X, включая LLM2SQLi, LLM2XSS, LLM2SSTI, LLM2CommandInjection, LLM2IDOR, LLM2CSRF, LLM2XXE и LLM2 SSRF. Наш анализ показывает, что LLM обычно не создает саму лежащую в основе уязвимость; Скорее, он действует как посреднический слой, а в некоторых настройках с поддержкой инструментов — как дезориентированный заместитель, переносящий влияние злоумышленника в компоненты, которые доверяют контенту, сгенерированному моделью или на который влияет модель. В качестве экспериментального примера мы реализуем TicketOracle, веб-приложение на основе Flask, интегрированное с LLM, для оценки LLM2SSRF в пяти сценариях атак и семи LLM. Наши результаты показывают существенные различия в уязвимости в зависимости от модели, что предполагает, что эксплуатация зависит как от небезопасной архитектуры приложения, так и от поведения, специфичного для модели. В заключение мы предлагаем стратегии смягчения последствий на уровнях подсказки, модели, приложения и сети. - From &lt;a href=&quot;https://arxiv.org/pdf/2608.10281&quot; target=&quot;_blank&quot;&gt;Prompt Injection to Web Exploitation: Revisiting Classic Vulnerabilities in LLM-Integrated Applications&lt;/a&gt;

&lt;p&gt;См. также другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=LLM&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;LLM&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/3569935505178891363/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/3569935505178891363' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/3569935505178891363'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/3569935505178891363'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/llm.html' title='Уязвимости в связке LLM и веб-приложений'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-1054969313376857429</id><published>2026-09-09T10:30:00.000+03:00</published><updated>2026-09-09T10:30:00.111+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="Архитектура"/><title type='text'>Fine tuning vs. RAG</title><content type='html'>Общее правило, которым руководствуются большинство специалистов: RAG в основном расширяет знания модели. Тонкая настройка в основном влияет на поведение выходных данных.
 - &lt;a href=&quot;https://towardsdatascience.com/how-to-fine-tune-an-llm-an-end-to-end-guide/&quot; target=&quot;_blank&quot;&gt;How to Fine-Tune an LLM: An End-to-End Guide&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/1054969313376857429/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/1054969313376857429' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/1054969313376857429'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/1054969313376857429'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/fine-tuning-vs-rag.html' title='Fine tuning vs. RAG'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-5382457204719604993</id><published>2026-09-08T10:00:00.000+03:00</published><updated>2026-09-08T10:00:00.130+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Вечные бэкдоры</title><content type='html'>Люди способны к стратегическому обману: в большинстве ситуаций они ведут себя полезно, но затем, получив возможность, резко меняют свое поведение, чтобы преследовать альтернативные цели. Если бы система ИИ научилась такой обманной стратегии, смогли бы мы обнаружить и устранить ее, используя современные методы обучения безопасности? Для изучения этого вопроса мы создаем демонстрационные примеры обманного поведения в больших языковых моделях (LLM). Например, мы обучаем модели, которые пишут безопасный код, когда в подсказке указано, что год 2023, но вставляют уязвимый код, когда указан год 2024. Мы обнаруживаем, что такое поведение типа «бэкдор» может быть устойчивым, так что его не удаляют стандартные методы обучения безопасности, включая контролируемую тонкую настройку, обучение с подкреплением и состязательное обучение (вызывание небезопасного поведения, а затем обучение его устранению). Поведение типа «бэкдор» наиболее устойчиво в самых больших моделях и в моделях, обученных создавать цепочку рассуждений о том, как обмануть процесс обучения, причем устойчивость сохраняется даже после удаления цепочки рассуждений. Кроме того, вместо удаления бэкдоров, мы обнаружили, что состязательное обучение может научить модели лучше распознавать триггеры своих бэкдоров, эффективно скрывая небезопасное поведение. Наши результаты показывают, что, как только модель начинает демонстрировать обманчивое поведение, стандартные методы могут оказаться неспособными устранить такой обман и создать ложное впечатление безопасности. - &lt;a href=&quot;https://arxiv.org/abs/2401.05566&quot; target=&quot;_blank&quot;&gt;Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training&lt;/a&gt;

&lt;p&gt;См. также другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=LLM&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;LLM&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/5382457204719604993/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/5382457204719604993' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/5382457204719604993'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/5382457204719604993'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/blog-post_08.html' title='Вечные бэкдоры'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-655093318742336976</id><published>2026-09-07T10:00:00.000+03:00</published><updated>2026-09-07T10:00:00.126+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><category scheme="http://www.blogger.com/atom/ns#" term="ссылки"/><title type='text'>MS кибербез</title><content type='html'>Компания Microsoft представила свою первую модель ИИ для кибербезопасности, MAI-Cyber-1-Flash, которая, по утверждению компании, показала значительно лучшие результаты в обнаружении уязвимостей, чем её основные конкуренты.
&lt;p&gt;
MAI-Cyber-1-Flash, разработанная для выявления сложных уязвимостей в сложном коде, интегрирована в многоагентную систему идентификации и устранения уязвимостей MDASH от Microsoft.
&lt;p&gt;
MDASH объединяет более 100 специализированных агентов ИИ в рамках множества передовых и упрощенных моделей ИИ и использовалась для обнаружения множества уязвимостей в собственных кодовых базах технологического гиганта.
&lt;p&gt;
По данным Microsoft, тестирование в рамках системы оценки кибербезопасности CyberGym показало, что MAI-Cyber-1-Flash (в сочетании с MDASH и GPT-5.4) превзошла недавно выпущенную Google 3.5 Flash Cyber, OpenAI GPT-5.6 Sol и Anthropic Mythos 5 по обнаружению уязвимостей.
  
&lt;p&gt;&lt;a href=&quot;https://www.securityweek.com/microsoft-unveils-mai-cyber-1-flash-its-first-cybersecurity-ai-model&quot; target=&quot;_blank&quot;&gt;отсюда&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/655093318742336976/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/655093318742336976' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/655093318742336976'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/655093318742336976'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/ms.html' title='MS кибербез'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-1433826339088751463</id><published>2026-09-06T18:44:48.299+03:00</published><updated>2026-09-06T18:44:48.299+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="Архитектура"/><title type='text'>Руководство по Claude Code</title><content type='html'>Коллективное руководство, написанное пользователями &lt;a href=&quot;https://claude.com/blog/claude-code-guide-for-startups&quot; target=&quot;_blank&quot;&gt;The Claude Code guide for startups&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/1433826339088751463/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/1433826339088751463' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/1433826339088751463'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/1433826339088751463'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/claude-code.html' title='Руководство по Claude Code'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-7731357306953706136</id><published>2026-09-04T10:00:00.000+03:00</published><updated>2026-09-04T10:00:00.161+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>ИИ в атаке</title><content type='html'>Компания Booz Allen выпустила отчет &lt;a href=&quot;https://www.boozallen.com/content/dam/home/docs/cyber/the-offensive-frontier-ai-as-the-attacker.pdf&quot; target=&quot;_blank&quot;&gt;«The Offensive Frontier: AI as the Attacker»&lt;/a&gt;

&lt;p&gt;Отчет по документу Booz Allen «The Offensive Frontier: AI as the Attacker» (2026)

&lt;p&gt;
Согласно отчету, в 2026 году произошел критический сдвиг: ведущие модели ИИ (в частности, Anthropic&#39;s Claude Mythos) теперь способны автономно выполнять полный цикл кибератаки (от разведки до полного контроля над сетью) в реальных условиях. Это переводит ИИ из статуса инструмента хакера в статус самостоятельного оператора.

&lt;p&gt;
Booz Allen протестировала 18 передовых моделей (американских и китайских) по новому индексу Cyber Weapon Index (CWI). Ключевые результаты:
&lt;br&gt;
&lt;b&gt;Лидер:&lt;/b&gt; Только одна модель (Anthropic Claude Mythos) получила наивысший балл, успешно пройдя все этапы атаки, включая создание эксплойтов для новых уязвимостей.
&lt;br&gt;
&lt;b&gt;Широкое распространение способностей:&lt;/b&gt; Около двух третей протестированных моделей смогли самостоятельно получить первоначальный доступ к защищенной сети. Многие модели достигают этапов кражи учетных данных и горизонтального перемещения.
&lt;br&gt;
&lt;b&gt;Отсутствие &quot;национального&quot; преимущества:&lt;/b&gt; Значительной разницы между возможностями американских и китайских моделей не выявлено. Ожидается, что большинство моделей достигнут полного потенциала в течение 6 месяцев.
&lt;br&gt;
&lt;b&gt;Ключевая уязвимость:&lt;/b&gt; Все модели (кроме лидирующих) провалили тест на поиск реальной (новой) уязвимости в сложном коде, показав 0% результативность. Это создает временное окно для усиления защиты.

&lt;p&gt;Критические факторы риска:
&lt;br&gt;З&lt;i&gt;начение &quot;обвязки&quot; (Attack Harness):&lt;/i&gt; Программное обеспечение, соединяющее модель с инструментами, может усилить возможности модели настолько, что менее продвинутая модель в &quot;обвязке&quot; сравняется с лидером. Это означает, что реальную угрозу представляет вся система ИИ (модель + инструменты + автономия), а не только сама модель.
&lt;br&gt;&lt;i&gt;Нестабильность ограничений (Guardrails):&lt;/i&gt; Отказ модели выполнять атаку может быть обойден изменением контекста задачи (например, использованием &quot;специализированной&quot; версии модели или сменой формулировки).
&lt;br&gt;&lt;i&gt;Слепые зоны оценки:&lt;/i&gt; Стандартные бенчмарки не измеряют операционные возможности модели в реальных атаках, что создает иллюзию безопасности.

&lt;p&gt;Рекомендации для США

&lt;br&gt;Документ предлагает три стратегических шага для достижения &quot;кибер-превосходства&quot; (Cyber Overmatch):
&lt;p&gt;
1.  Агрессивно внедрять &quot;контр-ИИ&quot; (Counter-AI):
    &lt;ul&gt;
    &lt;li&gt;   Перепроектировать киберзащиту для активного противодействия автономным атакующим (например, используя тактики обмана).&lt;/li&gt;
    &lt;li&gt;   Встроить ИИ во все этапы защиты (обнаружение, реагирование) для перехода на машинную скорость.&lt;/li&gt;
    &lt;li&gt;   *Результат в тестах*: Координированные &quot;контр-ИИ&quot; тактики снизили успешность атак более чем на 95%.&lt;/li&gt;
    &lt;/ul&gt;

&lt;p&gt;
2.  Ввести обязательные требования к готовности критической инфраструктуры:
    &lt;ul&gt;
    &lt;li&gt;    Установить отраслевые стандарты и дедлайны для демонстрации устойчивости к ИИ-атакам.&lt;/li&gt;
    &lt;li&gt;   Проводить регулярные учения с имитацией текущих ИИ-возможностей.&lt;/li&gt;
   &lt;li&gt;    Сместить фокус с предотвращения вторжений на сдерживание и ограничение ущерба (Zero Trust, сегментация).&lt;/li&gt;
    &lt;/ul&gt;

&lt;p&gt;
3.  Постоянно отслеживать глобальный ландшафт ИИ-возможностей:
    &lt;ul&gt;
    &lt;li&gt;    Создать национальную программу независимого тестирования моделей (включая зарубежные и открытые) в реалистичных сценариях.&lt;/li&gt;
    &lt;li&gt;   Превращать данные тестирования в систему раннего предупреждения для корректировки оборонных стратегий.&lt;/li&gt;
    &lt;li&gt;   Обеспечить контролируемый доступ защитников к передовым ИИ-инструментам для разработки средств защиты.&lt;/li&gt;
     &lt;/ul&gt;

&lt;p&gt;Прогноз развития:
  &lt;ul&gt;
 &lt;li&gt; Ближайшее время: Массовое распространение ИИ-атак, снижение порога входа для киберпреступников.&lt;/li&gt;
    &lt;li&gt; В течение месяцев: Появление &quot;по требованию&quot; эксплойтов для новых уязвимостей (zero-day).&lt;/li&gt;
 &lt;li&gt; 1-2 года: Возможный переход преимущества к защитникам, которые смогут использовать ИИ для упреждающей защиты.&lt;/li&gt;
 &lt;li&gt; 2-3 года: Появление самоулучшающихся моделей, способных адаптировать тактику атаки в режиме реального времени.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;
Заключительный вывод: Автономные ИИ-атаки больше не гипотетическая угроза. Будущее лидерство в киберпространстве достанется не тем, у кого больше ИИ, а тем, кто сможет быстрее адаптировать свои наступательные и оборонительные операции к новой реальности.
  </content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/7731357306953706136/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/7731357306953706136' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/7731357306953706136'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/7731357306953706136'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/blog-post_04.html' title='ИИ в атаке'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-4730358675131741282</id><published>2026-09-03T16:43:55.029+03:00</published><updated>2026-09-03T16:43:55.030+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="Жизнь"/><title type='text'>И снова о регуляции ИИ</title><content type='html'>На встрече лидеров отрасли и министров торговли в Северной Каролине США призвали членов G20 занять невмешательскую позицию в регулирование ИИ и избегать создания правил для этой технологии.
Цели США в значительной степени совпадают с мнением крупнейших мировых компаний, занимающихся ИИ, почти все из которых являются американскими. Они хотят меньшего регулирования во всем мире для своих быстрорастущих предприятий или хотят формировать правила по мере их написания. Требования федерального правительства могут нанести ущерб прибыли отрасли, если они замедлят выпуск новых моделей или побудят компании изменить характеристики своей продукции для решения проблем безопасности.
&lt;p&gt;
Советник США по технологиям Майкл Крациос, который является соорганизатором двухдневной встречи, призвал страны принять «Каролинские принципы». Страны, подписавшие соглашение, договорились избегать разработки совершенно новых правил для ИИ и вместо этого сосредоточиться на разработке правил для «новых» ситуаций, связанных с этой технологией.
  
&lt;p&gt;/via Reuters</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/4730358675131741282/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/4730358675131741282' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/4730358675131741282'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/4730358675131741282'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/09/blog-post.html' title='И снова о регуляции ИИ'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-3816423159690885578</id><published>2026-08-31T10:30:00.000+03:00</published><updated>2026-08-31T10:30:00.114+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Крипто-промпт инъекция</title><content type='html'>Статические средства защиты классифицируют входные данные как текст; они не выполняют их. Злоумышленник отправляет зашифрованный текст вместе с ключевым материалом и инструкцией по его расшифровке, и модель выполняет эту расшифровку внутри своей собственной песочницы выполнения кода. Все, что потребовалось бы сканеру средства защиты, находится прямо на странице, но для восстановления открытого текста необходимо запустить PBKDF2 и AES-256-GCM, чего ни один классификатор контента не делает во время проверки. В отличие от base64 или шифра подстановки, собственные веса модели также не могут использовать какой-либо короткий путь. Расшифрованные инструкции злоумышленника затем отображаются как результат выполнения кода, который модель только что запустила, внутри доверенного контекста выполнения, и не помечаются как недоверенные входные данные. Модель обрабатывает их как авторитетные. Выполнение во время выполнения преобразует данные, контролируемые злоумышленником, в доверенные инструкции, которые будет выполнять агент. Именно так атака получила свое название: криптография помогает создать доверенный контекст для агента.
&lt;p&gt;
А как модель получит эти зашифрованные данные? Например, будет читать какую-то веб-страницу, на которой будет размещен зашифрованный JSON. Тема инъекции подсказок для моделей будет вечной ...
  
&lt;p&gt;&lt;a href=&quot;https://adversa.ai/blog/cryptographic-context-injection-grok-data-theft&quot; target=&quot;_blank&quot;&gt;Отсюда&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/3816423159690885578/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/3816423159690885578' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/3816423159690885578'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/3816423159690885578'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/blog-post_31.html' title='Крипто-промпт инъекция'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-6069873496937132018</id><published>2026-08-30T13:16:00.000+03:00</published><updated>2026-08-30T13:16:00.109+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Безопасность MCP</title><content type='html'>&lt;a href=&quot;https://modelcontextprotocol.io/docs/2026-07-28/tutorials/security/security_best_practices&quot; target=&quot;_blank&quot;&gt;Лучшие практики по безопасности MCP&lt;/a&gt;
&lt;p&gt;
&lt;a href=&quot;https://blog.mcpservers.org/posts/mcp-security-best-practices&quot; target=&quot;_blank&quot;&gt;Руководство по безопасности MCP в 2026&lt;/a&gt;

&lt;p&gt;См. другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=MCP&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;MCP&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/6069873496937132018/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/6069873496937132018' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/6069873496937132018'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/6069873496937132018'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/mcp_0927401713.html' title='Безопасность MCP'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-2306950260783396475</id><published>2026-08-29T11:58:00.000+03:00</published><updated>2026-08-29T11:58:00.240+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="Архитектура"/><title type='text'>Архитектура ИИ приложений</title><content type='html'>Практические материалы по построению:
&lt;p&gt;&lt;a href=&quot;https://medium.datadriveninvestor.com/enterprise-ai-control-plane-architecture-separating-governance-from-execution-6772a1176f53&quot; target=&quot;_blank&quot;&gt;LLM шлюзов&lt;/a&gt;
&lt;p&gt;&lt;a href=&quot;https://pub.towardsai.net/building-production-agent-platforms-mcp-security-governance-and-ai-finops-ec4d0d54456a&quot; target=&quot;_blank&quot;&gt;ИИ агентов&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/2306950260783396475/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/2306950260783396475' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/2306950260783396475'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/2306950260783396475'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/blog-post_29.html' title='Архитектура ИИ приложений'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-7951521031088015212</id><published>2026-08-28T10:55:00.000+03:00</published><updated>2026-08-28T10:55:00.108+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Борьба с шифровальщиками</title><content type='html'>&lt;a href=&quot;https://nvlpubs.nist.gov/nistpubs/ir/2026/NIST.IR.8374r1.pdf&quot; target=&quot;_blank&quot;&gt;Рекомендации NIST по борьбе с шифровальщиками&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/7951521031088015212/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/7951521031088015212' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/7951521031088015212'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/7951521031088015212'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/blog-post_28.html' title='Борьба с шифровальщиками'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-6082849814072903541</id><published>2026-08-27T10:47:00.000+03:00</published><updated>2026-08-27T10:47:00.111+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Стратегии улучшения робастности</title><content type='html'>Модели машинного обучения, в частности архитектуры глубокого обучения, демонстрируют высокую производительность в задачах прогнозирования, но остаются уязвимыми для атак с использованием состязательных методов. Цель данного исследования — повысить устойчивость сверточных нейронных сетей (CNN), глубоких нейронных сетей (DNN) и рекуррентных нейронных сетей (RNN), тем самым улучшив безопасность систем машинного обучения. Применяется трехэтапный подход. Во-первых, выполняется классификация безопасных образцов с использованием эталонного набора данных MNIST. Во-вторых, на обученные модели запускаются атаки с использованием состязательных методов, а именно Projected Gradient Descent (PGD), DeepFool (DF) и Fast Gradient Sign Method (FGSM), что приводит к значительному снижению производительности. На основе искаженных выходных данных, вызванных состязательными возмущениями, впоследствии создается модель обнаружения состязательных методов. В-третьих, для противодействия этим атакам используются различные стратегии защиты, включая состязательное обучение, защитную дистилляцию, шумоподавление на основе автокодировщика, ансамблевые методы и сжатие признаков, которые оцениваются с использованием стандартных метрик производительности и графического анализа. Результаты показывают, что в отсутствие механизмов защиты атаки PGD приводят к снижению точности примерно на 27% в CNN, на 83% в DNN и на 90% в RNN, демонстрируя серьезные уязвимости моделей. Однако при применении стратегий защиты все модели восстанавливаются до точности не менее 98,9%, при этом состязательное обучение улучшает производительность при атаке до 90%. Среди оцененных моделей CNN демонстрируют самую высокую базовую устойчивость, в то время как DNN и RNN в большей степени полагаются на механизмы защиты для поддержания производительности. Эти результаты предоставляют ценную информацию для разработки безопасных и отказоустойчивых систем машинного обучения, способных смягчать состязательные угрозы. - &lt;a href=&quot;https://www.proquest.com/openview/cf2c33d1f42d14c6411bb52d12a78d97/1?pq-origsite=gscholar&amp;amp;cbl=2026672&quot; target=&quot;_blank&quot;&gt;Enhanced Robustness in Neural Network Models against Adversarial Attacks and their Performance Analysis&lt;/a&gt;

&lt;p&gt;См. также другие публикации по теме &lt;a href=&quot;https://abava.blogspot.com/search?q=adversarial&amp;amp;max-results=20&amp;amp;by-date=true&quot;&gt;adversarial&lt;/a&gt;, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=%D1%83%D1%81%D1%82%D0%BE%D0%B9%D1%87%D0%B8%D0%B2%D0%BE%D0%BC%D1%83&amp;amp;max-results=20&amp;amp;by-date=true&quot;&gt;устойчивому машинному обучению&lt;/a&gt; </content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/6082849814072903541/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/6082849814072903541' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/6082849814072903541'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/6082849814072903541'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/blog-post_27.html' title='Стратегии улучшения робастности'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-422446304894915288</id><published>2026-08-26T11:30:00.000+03:00</published><updated>2026-08-26T11:30:00.112+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="Архитектура"/><category scheme="http://www.blogger.com/atom/ns#" term="Чтиво"/><category scheme="http://www.blogger.com/atom/ns#" term="техническое"/><title type='text'>Физический ИИ и Интернет Вещей</title><content type='html'>&lt;a href=&quot;https://iot-now.com/2026/07/13/157389-physical-ai-holds-a-lot-of-promise-for-iot-but-there-are-significant-challenges/&quot; target=&quot;_blank&quot;&gt;‘Physical AI’ holds a lot of promise for IoT, but there are significant challenges&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/422446304894915288/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/422446304894915288' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/422446304894915288'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/422446304894915288'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/blog-post_26.html' title='Физический ИИ и Интернет Вещей'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-2076536881777762961</id><published>2026-08-25T10:00:00.000+03:00</published><updated>2026-08-25T10:00:00.196+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="Архитектура"/><title type='text'>Чего не может LLM</title><content type='html'>&quot;В конечном счете, работа никогда не заключалась в коде. Код был той частью, которая выглядела как работа. Решение о том, что стоит строить и стоит ли это строить, неизбежно останется прежним.&quot; - &lt;a href=&quot;https://queue.acm.org/detail.cfm?id=3834784&quot; target=&quot;_blank&quot;&gt;&quot;Where to Draw the Line. Which decisions should not be handed over to LLMs?&quot; by Craig A. N. Soules&lt;/a&gt;</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/2076536881777762961/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/2076536881777762961' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/2076536881777762961'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/2076536881777762961'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/llm_01398492075.html' title='Чего не может LLM'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-723034337161491363</id><published>2026-08-24T10:30:00.000+03:00</published><updated>2026-08-24T10:30:00.113+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Текстовые водяные знаки в Claude</title><content type='html'>LLM генерируют текст слово за словом. На каждом шаге они генерируют вероятности для следующего вероятного слова. Вместо случайной выборки из этих слов, метод водяного знака изменяет список слов, которые разрешено выбирать.
&lt;p&gt;
&lt;i&gt;Как нанести водяной знак на ответ?&lt;/i&gt;
&lt;p&gt;
Шаг 1: Модель генерирует вероятности для следующего слова.
&lt;p&gt;
Шаг 2: Обычно генератор случайных чисел выбирает один из подходящих кандидатов. При использовании водяного знака ключевая функция берет секретный ключ плюс несколько предыдущих слов и определяет, какие кандидаты являются допустимыми для выбора.
&lt;p&gt;
Шаг 3: Это повторяется для всего ответа. Места, где есть несколько правдоподобных вариантов, несут сигнал водяного знака.
&lt;p&gt;
&lt;br&gt;
&lt;i&gt;Как обнаружить текст с водяным знаком?&lt;/i&gt;
&lt;p&gt;
Шаг 1: Для любого слова-кандидата в тексте мы проверяем, является ли оно допустимым выбором на основе секретного ключа и нескольких предшествующих слов. Если слово допустимо, это считается совпадением.
&lt;p&gt;
Шаг 2: Проверяем это по всему тексту. Текст с водяным знаком совпадает гораздо чаще. Общий процент совпадений можно рассматривать как оценку, сгенерированную ИИ.
  
&lt;p&gt;&lt;div class=&quot;separator&quot; style=&quot;clear: both;&quot;&gt;&lt;a href=&quot;https://blogger.googleusercontent.com/img/b/R29vZ2xl/AVvXsEiMm_2QRmJkkRV9FgeBOhQGNcY650Ph1tYyCvKUDKOwNf0NAi1D-Tc2VyNIPHEaIuxKRUYUS3l8E6OvHpRVXVpZsHPK0ef_fburZRL5a9N7hqZ6icFKiZJsM17CUoUAIAPVkLT617y0Vm6wPjDMixlA33_3egagDJf-bQSacLCIxYcltKnjMzv1Yw/s1546/watermark.jpg&quot; style=&quot;display: block; padding: 1em 0; text-align: center; &quot;&gt;&lt;img alt=&quot;&quot; border=&quot;0&quot; height=&quot;400&quot; data-original-height=&quot;1546&quot; data-original-width=&quot;1280&quot; src=&quot;https://blogger.googleusercontent.com/img/b/R29vZ2xl/AVvXsEiMm_2QRmJkkRV9FgeBOhQGNcY650Ph1tYyCvKUDKOwNf0NAi1D-Tc2VyNIPHEaIuxKRUYUS3l8E6OvHpRVXVpZsHPK0ef_fburZRL5a9N7hqZ6icFKiZJsM17CUoUAIAPVkLT617y0Vm6wPjDMixlA33_3egagDJf-bQSacLCIxYcltKnjMzv1Yw/s400/watermark.jpg&quot;/&gt;&lt;/a&gt;&lt;/div&gt;

&lt;p&gt;Via &lt;a href=&quot;https://blog.bytebytego.com/&quot; target=&quot;_blank&quot;&gt;ByteByteGo&lt;/a&gt;
  
&lt;p&gt;Компания Anthropic выложила отдельный документ, &lt;a href=&quot;https://www.anthropic.com/news/claude-text-watermark&quot; target=&quot;_blank&quot;&gt;посвященный водяным знакам&lt;/a&gt;.

Подход Клода основан на &lt;a href=&quot;https://www.nature.com/articles/s41586-024-08025-4&quot; target=&quot;_blank&quot;&gt;SynthID-Text&lt;/a&gt;, методе, опубликованном исследователями Google в 2024 году. Для размеченного текста секретный, рандомизированный процесс — называемый в статье Google «генератором начальных значений» — незаметно подталкивает модель к определенным вариантам слов по мере генерации текста. Эти варианты создают шаблон, который впоследствии может быть обнаружен функцией оценки, измеряющей, насколько текст соответствует шаблону. SynthID-Text дает статистический балл, указывающий, насколько сильно фрагмент текста соответствует водяному знаку, связанному с его секретным ключом. Anthropic заявляет о выпуске API, который будет присваивать этот вероятностный балл представленному тексту.
&lt;br&gt;
Сигнал водяного знака дает вероятность использования метода Клода, но не является окончательным доказательством сгенерированного текста. Кроме того, возможны ложные отрицательные результаты. Информация, созданная людьми, но обобщенная, переведенная, сжатая или объединенная с синтетической информацией, может содержать сигнал водяного знака.
&lt;p&gt;
Модели Claude не генерируют изображения с нуля, но могут редактировать и обрабатывать изображения или генерировать их с помощью кода. Эти изображения будут содержать криптографически подписанные учетные данные в своих метаданных. Метод, называемый &lt;a href=&quot;https://c2pa.org/&quot; target=&quot;_blank&quot;&gt;C2PA&lt;/a&gt;, помогает подтвердить происхождение изображения или видео. C2PA отличается от текстового водяного знака тем, что, в отличие от SynthID-Text, в содержимом ничего не изменяется. Любое программное обеспечение, считывающее учетные данные C2PA, может идентифицировать данные Anthropic, и компания предоставит собственный инструмент проверки.
&lt;p&gt;
Компания заявила, что водяные знаки не (i) снижают качество вывода, (ii) не видны читателю, (iii) не требуют дополнительных токенов и не являются более дорогими, а также (iv) не содержат идентифицирующей информации, которая позволила бы отследить текст до пользователя.
&lt;br&gt;
Водяные знаки разработаны таким образом, чтобы быть постоянными. Они сохраняются после копирования и вставки, а также после некоторого редактирования. С другой стороны, текст, который сильно отредактирован или перефразирован, и изображения, изображения, из которых удалены метаданные в результате преобразования формата, могут не содержать водяного знака.
&lt;br&gt;
В коде и другом детерминированном тексте, как правило, будет меньше водяных знаков. В отличие от прозы, для кода или более точных полей часто существует оптимальный вариант — например, следующий символ для 2 + 2 = неизбежно должен быть 4. Но текстовые водяные знаки все равно будут использоваться в случаях, когда нет детерминированного оптимального варианта, и в комментариях к коду. Это делает код, сгенерированный ИИ, обнаруживаемым.
&lt;p&gt;
Объявление вызвало широкую негативную реакцию, многие критики заявили, что водяные знаки неэффективны, вредны или нарушают конфиденциальность пользователей ИИ. Сторонники утверждали, что различение текста, сгенерированного ИИ, и текста, написанного человеком, может фактически помочь инженерам ИИ.
&lt;p&gt;
По неофициальным данным, десятки пользователей Claude на X (Twitter) заявили, что отменили свои подписки на Claude. Тем не менее, Anthropic заявила, что не наблюдала заметного увеличения числа отмен.
&lt;br&gt;
Некоторые пользователи считают, что незначительные изменения в сгенерированном тексте ухудшат качество результата, несмотря на заверения Anthropic об обратном. Другие опасаются репутационного ущерба, связанного с ложными срабатываниями, и утверждают, что обнаружение водяных знаков недостаточно тонко учитывает особенности использования ИИ. Например, человека, использующего Claude для редактирования, могут обвинить в том, что его сообщения полностью сгенерированы ИИ; юрист может столкнуться с негативной реакцией судей или противоположной стороны из-за помеченного юридического документа, даже если его содержание является точным. Другие специалисты разделяют подобные опасения.
&lt;br&gt;
Некоторые критики утверждают, что водяные знаки не обладают достаточной точностью, поскольку помеченный текст потенциально может быть удален путем обработки текста другой моделью ИИ, или потому что детектор API одной компании не может обнаружить текст, сгенерированный другими LLM-моделями. Кроме того, бывший руководитель Microsoft Стивен Синофски заявил на X, что пользователи должны иметь «право на личные мысли, свободные от цифрового следа».
&lt;br&gt;
Другие критики опасаются, что Anthropic будет использовать водяные знаки для подтверждения заявлений о копировании или упрощении их моделей другими компаниями в рамках усилий Anthropic по пресечению деятельности конкурентов по всему миру.
&lt;p&gt;
Сторонники считают, что прозрачность в отношении использования ИИ — это позитивное развитие. Скотт Ааронсон, профессор информатики, чья работа заложила основу для SynthID-Text, утверждал, что даже если методы обнаружения не идеальны, водяные знаки могут помочь предотвратить академическое мошенничество и плагиат. А некоторые исследователи в области ИИ утверждают, что водяные знаки могут быть полезны для предотвращения неосознанного обучения на синтетическом контенте, что может привести к усилению предвзятости или краху модели в новых генеративных моделях.
&lt;p&gt;
Anthropic — не единственная компания, которой придется разработать способ обнаружения сгенерированного текста; она просто первая. Статья 50 Закона ЕС об ИИ требует наличия машиночитаемых водяных знаков для сгенерированного контента, включая текст, изображения, аудио и видео. Однако Anthropic решила применять это правило глобально, а не только в пределах ЕС. Некоторые крупные разработчики ИИ, включая OpenAI, Google, Meta и Microsoft, также подписали Кодекс практики ЕС по прозрачности контента, созданного ИИ, — добровольную систему, демонстрирующую соответствие требованиям Закона об ИИ в отношении маркировки и обозначения контента, созданного ИИ. Эти и другие компании могут использовать различные методы, и еще предстоит выяснить, будут ли они внедрять водяные знаки только в ЕС или во всем мире.
&lt;p&gt;
Deeplearning.ai придерживается мнения, что следует регулировать не саму технологию, а случаи использования ИИ в вредных целях. Методы водяных знаков и обнаружения, используемые Anthropic, встроены в технологию, незаметно изменяя сгенерированный текст. Борьба с плагиатом и идентификация синтетического контента для создателей моделей могут быть похвальными целями, но мы предполагаем, что повсеместное использование водяных знаков окажется слишком грубым инструментом, открывающим ящик Пандоры проблем, связанных с конфиденциальностью, качеством результатов и вредными ложными срабатываниями.</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/723034337161491363/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/723034337161491363' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/723034337161491363'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/723034337161491363'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/claude.html' title='Текстовые водяные знаки в Claude'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://blogger.googleusercontent.com/img/b/R29vZ2xl/AVvXsEiMm_2QRmJkkRV9FgeBOhQGNcY650Ph1tYyCvKUDKOwNf0NAi1D-Tc2VyNIPHEaIuxKRUYUS3l8E6OvHpRVXVpZsHPK0ef_fburZRL5a9N7hqZ6icFKiZJsM17CUoUAIAPVkLT617y0Vm6wPjDMixlA33_3egagDJf-bQSacLCIxYcltKnjMzv1Yw/s72-c/watermark.jpg" height="72" width="72"/><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-2350782893690248082</id><published>2026-08-23T11:20:59.906+03:00</published><updated>2026-08-23T11:20:59.906+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="курсы"/><title type='text'>Курсы по  ИИ-агентам</title><content type='html'>Симпатичные курсы (на русском) - &lt;a href=&quot;https://bigdatateam.org/ru/artificial-intelligence-course&quot; target=&quot;_blank&quot;&gt;Agentic Coding &amp; AI Agents&lt;/a&gt;

&lt;p&gt;См. также другие публикации, посвященные &lt;a href=&quot;https://abava.blogspot.com/search?q=agents&amp;amp;max-results=20&amp;amp;by-date=true&quot; target=&quot;_blank&quot;&gt;агентам&lt;/a&gt;
</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/2350782893690248082/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/2350782893690248082' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/2350782893690248082'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/2350782893690248082'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/blog-post_23.html' title='Курсы по  ИИ-агентам'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-8369178027491896983</id><published>2026-08-22T12:17:00.000+03:00</published><updated>2026-08-22T12:17:00.112+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>И снова о безопасности ИИ</title><content type='html'>Растет количество организаций, занятых исключительно такой тематикой. Вот еще одна новая компания.

&lt;p&gt;
&quot;&lt;a href=&quot;https://guidelight.ai/&quot; target=&quot;_blank&quot;&gt;Guidelight&lt;/a&gt; — это новая независимая некоммерческая организация, основанная Пейдж Хедли и Стивеном Адлером (оба — бывшие руководители OpenAI по вопросам безопасности), которая сотрудничает с независимыми экспертами, компаниями, занимающимися ИИ, и общественностью для определения важных методов обеспечения безопасности и содействия их внедрению.
&lt;p&gt;
В настоящее время компании, работающие в сфере ИИ, недостаточно инвестируют в безопасность, опасаясь отстать от менее осторожных конкурентов. Наша стратегия заключается в устранении этих стимулов и сосредоточении усилий компаний на наиболее важных методах обеспечения безопасности.
&lt;p&gt;
У нас есть три взаимодополняющие программы:
&lt;p&gt;
1.Стандарты
&lt;br&gt;
Мы сочетаем принципы безопасности с конкретными практическими методами, которые их реализуют, синтезируя существующие исследования, мнения экспертов и наш собственный опыт.
&lt;p&gt;
2. Оценки
&lt;br&gt;
Мы оцениваем текущие методы работы компаний в соответствии с этими стандартами и публикуем результаты, опираясь на общедоступную информацию, достоверные отчеты и заявления компаний.
&lt;p&gt;
3. Стимулирование
&lt;p&gt;
Мы стимулируем внедрение компаниями более безопасных методов работы, поддерживая сотрудников, заботящихся о безопасности, внутри компании и создавая конкурентное давление со стороны клиентов, инвесторов и общественности.
&lt;p&gt;
Для того чтобы решения компаний в области безопасности учитывались общественные интересы, необходима независимость от этих компаний. Guidelight не принимает финансирование от компаний, занимающихся искусственным интеллектом, или от их сотрудников.
&lt;p&gt;
Наша цель — коммерческая среда, где безопасность выгодна, где интересы компаний, занимающихся искусственным интеллектом, и общественности совпадают.&quot;

&lt;p&gt;И вот их интересный отчет &lt;a href=&quot;https://guidelight.ai/blog/control-assessment-august-2026&quot; target=&quot;_blank&quot;&gt;AI Control: An Assessment of Frontier Practices&lt;/a&gt;. Согласно своему &lt;a href=&quot;https://guidelight.ai/control&quot; target=&quot;_blank&quot;&gt;стандарту&lt;/a&gt; были оценены разработки пяти лидирующих компаний: Anthropic, OpenAI, Google, xAI,
Meta.
&lt;p&gt;Оценивались 6 практик:
&lt;ul&gt;
  &lt;li&gt;Ведение журналов: регистрируйте действия внутренних ИИ для последующего мониторинга.&lt;/li&gt;
&lt;li&gt;Мониторинг эффективности: измеряйте эффективность мониторинга.&lt;/li&gt;
&lt;li&gt;Ограниченные действия: требуйте от наблюдателя подтверждения безопасности определенных действий ИИ с высоким риском, прежде чем они вступят в силу.&lt;/li&gt;
&lt;li&gt;Предотвращение сбоев: временно останавливайте системы ИИ после всплеска выявленного некорректного поведения.&lt;/li&gt;
&lt;li&gt;Независимая экспертиза: привлекайте сторонних специалистов для оценки адекватности мер контроля.&lt;/li&gt;
&lt;li&gt;План сдерживания: разработайте план сдерживания некорректно работающей модели.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;p&gt;См. также другие публикации по теме &lt;a href=&quot;https://abava.blogspot.com/search?q=%D0%B0%D1%83%D0%B4%D0%B8%D1%82&amp;amp;max-results=20&amp;amp;by-date=true&quot;&gt;аудит&lt;/a&gt;
  </content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/8369178027491896983/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/8369178027491896983' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/8369178027491896983'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/8369178027491896983'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/blog-post_22.html' title='И снова о безопасности ИИ'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry><entry><id>tag:blogger.com,1999:blog-21489562.post-2289336437069242952</id><published>2026-08-21T12:28:00.000+03:00</published><updated>2026-08-21T12:28:00.125+03:00</updated><category scheme="http://www.blogger.com/atom/ns#" term="big data"/><category scheme="http://www.blogger.com/atom/ns#" term="кибербезопасность"/><title type='text'>Секретные проверки</title><content type='html'>Белый дом исключает открытые модели из своей системы тестирования передовых возможностей ИИ, &lt;a href=&quot;https://www.axios.com/2026/08/04/trump-ai-framework-open-models&quot; target=&quot;_blank&quot;&gt;сообщили Axios источники, знакомые с ситуацией&lt;/a&gt;.
&lt;p&gt;
Почему это важно: Добровольная система определит, как администрация Трампа будет проверять передовые модели ИИ перед их выпуском, но Белый дом не публикует её.
&lt;p&gt;
Что внутри: Система ИИ, представленная администрацией Трампа, определяет «защищенную передовую модель» как модель с закрытым исходным кодом, обладающую самыми современными возможностями и представляющую угрозу национальной безопасности, сообщили многочисленные источники, знакомые с ходом встреч в Белом доме.
&lt;p&gt;
Четкого определения того, что считается передовым или представляющим угрозу национальной безопасности, нет.
Открытые модели исключены, и в системе прямо указано, что ничто в ней не должно интерпретироваться как ограничение открытых моделей после их выпуска.
  
&lt;p&gt;
Подробнее: В течение 30-дневного периода предварительной проверки правительством доступ сотрудников к моделям будет ограничен.
&lt;br&gt;
Модели будут храниться в средах с высоким уровнем безопасности, и потребуется вести подробные журналы доступа к моделям.
&lt;br&gt;
Процесс проверки будет включать в себя различных должностных лиц администрации, а не только одно ведомство или агентство.
В целом: Белый дом не планирует публично публиковать структуру, как ранее сообщал Axios.
&lt;p&gt;
Белый дом провел встречи на уровне сотрудников с представителями отрасли для проверки структуры, и компании, которые не были приглашены, остаются в неведении относительно ее содержания.
Также неясно, какие «доверенные партнеры» получат ранний доступ к передовым моделям в рамках этой структуры, в том числе, будут ли какие-либо иностранные правительства соответствовать критериям.
&lt;p&gt;
Контекст: В указе прямо говорится, что процесс оценки передовых кибервозможностей моделей ИИ будет засекречен.
&lt;br&gt;
В указе нет требования о публичной публикации добровольной структуры.
&lt;p&gt;
Что дальше: По сообщениям источников, знакомых с обсуждениями, во вторник компаниям было рекомендовано делиться с правительством моделями, максимально приближенными к публичному выпуску, а не моделями на ранних стадиях разработки.
&lt;p&gt;
Многие компании с менее продвинутыми системами, по всей видимости, останутся вне этой структуры, сообщили источники.</content><link rel='replies' type='application/atom+xml' href='https://abava.blogspot.com/feeds/2289336437069242952/comments/default' title='Post Comments'/><link rel='replies' type='text/html' href='https://www.blogger.com/comment/fullpage/post/21489562/2289336437069242952' title='0 Comments'/><link rel='edit' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/2289336437069242952'/><link rel='self' type='application/atom+xml' href='https://www.blogger.com/feeds/21489562/posts/default/2289336437069242952'/><link rel='alternate' type='text/html' href='https://abava.blogspot.com/2026/08/blog-post_21.html' title='Секретные проверки'/><author><name>Coldbeans software</name><uri>http://www.blogger.com/profile/12420146664135307227</uri><email>noreply@blogger.com</email><gd:image rel='http://schemas.google.com/g/2005#thumbnail' width='16' height='16' src='https://img1.blogblog.com/img/b16-rounded.gif'/></author><thr:total>0</thr:total></entry></feed>