В России принят закон о развитии технологий искусственного интеллекта. Документ вводит понятия суверенных и национальных моделей ИИ, однако вопросы защиты интересов авторов требуют проработки.
Игорь Дроздов
Заместитель председателя ВЭБ.РФ
Закон устанавливает, что использование произведений науки, литературы и искусства для обучения ИИ-модели не будет считаться нарушением авторских прав, если правообладатели не установили запрет на такое обучение. Этот подход вызывает вопросы с точки зрения защиты интересов производителей контента и противоречит положениям Гражданского кодекса, поэтому отдельные положения закона, вероятно, потребуют уточнения.
Вопрос о корректировке недавно принятого закона остается предметом профессиональной дискуссии. Дело в том, что в документе закреплен подход, который его разработчики позиционировали как аналог европейского регулирования в сфере извлечения текстов и данных. Однако в Европе этот опыт также переосмысливается.
Он был введен еще в 2019 г., до массового распространения генеративных нейросетей. Европейские регуляторы и эксперты уже приходят к выводу, что из-за такого регулирования авторы не получают за использование своего труда ни цента.
Норма о свободном использовании для обучения ИИ любого контента, за исключением случаев, когда правообладатель специально установил машиночитаемую метку с запретом, может оказаться недостаточно эффективной на практике. Система распознавания таких меток пока не получила широкого распространения. Пиратские ресурсы, где меток нет, остаются доступными для обучения. Это приводит к таким случаям, когда нейросети запросто выдают по запросу пользователей украденные книги.
Российский подход, допускающий столь широкое использование охраняемых произведений для обучения фундаментальных моделей, существенно отличается от регулирования в большинстве зарубежных юрисдикций. Наиболее консервативный из реально существующих подходов предполагает лицензионные соглашения с правообладателями и выплату вознаграждения.
Показателен недавний судебный прецедент с компанией Anthropic, которая выплатила правообладателям около $1,5 млрд за обучение на пиратских интернет-ресурсах. Суд в США однозначно указал, что использовать нелегальный контент для развития ИИ недопустимо.
Интересно, что в своих решениях американские суды допускают применение доктрины добросовестного использования (fair use) к процессу обучения, но исключительно при условии, что выдачи нейросетей не оказывают негативного влияния на рынок и экономические интересы правообладателей. Но генеративные модели всё чаще конкурируют с первоисточниками, в результате выручка перетекает к разработчикам ИИ в ущерб создателям контента. Поэтому теперь судебные решения склоняются к необходимости выплат.
На этом фоне российский закон пока не устанавливает специальных ограничений на использование контента, размещенного в интернете с нарушением авторских прав. Формально разрешено обучать модели на всем, что доступно в интернете и не защищено техническими средствами.
В результате разработчик получил возможность легально обучаться на материалах, которые были размещены незаконно. Также закон ничего не говорит о выдаче охраняемого авторским правом контента пользователям. Между тем юридическая «очистка» контента для использования в целях машинного обучения не освобождает разработчика модели от ответственности, если результат выдачи воспроизводит этот самый контент.
Даже когда нейросеть не выдает дословно использованный при обучении контент, выдача обнаруживает «полезные свойства» исходных произведений. Как следствие, потребители довольствуются такими выдачами и реже посещают сайты издательств, реже покупают книги, что бьет по журналистам, издателям, музыкантам и всем производителям текстового и аудиовизуального контента. При этом авторы лишены возможности получить вознаграждение за использование их контента при обучении ИИ-моделей.
Не менее серьезной представляется и юридико-техническая проблема. В Гражданском кодексе должно быть зафиксировано, что обучение на охраняемых произведениях является их использованием. Это снимет существующую неопределенность, которой сегодня пользуются разработчики, утверждающие, что преобразование контента в числовые параметры и их последующая обработка искусственным интеллектом не имеет отношения к копированию. Формально это может быть и так, но, по сути, такое возражение несостоятельно. Авторское право обеспечивает правообладателю защиту от несанкционированного доведения «полезных свойств» его произведения третьим лицам, а в выдаче нейросети эти свойства воспроизводятся.
Какой механизм компенсации правообладателям может быть предложен? Лицензирование, требующее согласия правообладателей на использование их произведений для машинного обучения, очевидно, невозможно по экономическим причинам — транзакционные издержки при работе с каждым из миллионов правообладателей окажутся запредельны. Другой проблемой является сложность администрирования этого механизма. Выявление правообладателей произведений, на которых была обучена ИИ-модель без его согласия, может представлять определенные затруднения.
Кроме того, на практике добиться фактического запрета на использование произведений для обучения ИИ-моделей технически невозможно. Единожды обученная на определенном контенте машина не может его «забыть». Поэтому целесообразно допустить использование охраняемого контента для обучения ИИ-моделей без согласия правообладателя с условием выплаты ему компенсации.
Наиболее работоспособной представляется модель компенсационных сборов по аналогии с существующими сборами за частное копирование. Сборы за частное копирование впервые появились в Германии в 1960-е гг. В это время благодаря распространению бытовых средств звукозаписи миллионы людей получили возможность осуществлять копирование в домашних условиях.
Индивидуальное лицензирование такого копирования оказалось невозможным. Идентификация каждого пользователя, переговоры об условиях лицензии были бы несоразмерны экономической ценности единичного акта копирования. Поэтому интересы правообладателей при частном копировании стали обеспечивать за счет выплаты им компенсации, централизованно формируемой за счет сбора с производителей звукозаписывающих устройств и носителей информации и распределяемой между правообладателями обществами по коллективному управлению правами.
Применительно к обучению ИИ-модели речь может идти о платеже, привязанном не к фактическому использованию каждого конкретного произведения, а к оборудованию, которое используется для обучения ИИ-модели, либо к выручке компаний-разработчиков. Такой сбор, во-первых, компенсирует потери правообладателей, во-вторых, не создаст бюрократических барьеров для технологического развития, а в-третьих, может легитимизировать выдачу фрагментов охраняемых произведений, снимая с разработчиков риск исков за их несанкционированное воспроизведение.
Целесообразно, чтобы в работе над изменениями закона участвовали представители технологической отрасли, правообладателей и креативных индустрий. Без включения авторов в систему распределения доходов от технологий искусственного интеллекта невозможно говорить о справедливом балансе интересов.