Узбекистан, Ташкент – АН Podrobno.uz. OpenAI в ближайшие недели начнет добавлять невидимый водяной знак к текстам, созданным ChatGPT и Codex в ответ на требования закона Евросоюза об искусственном интеллекте, который предусматривает возможность машинного определения контента, созданного генеративным ИИ.
Об этом OpenAI сообщила 5 октября. Компания подчеркнула, что технологии текстовой маркировки и определения ИИ-контента пока находятся на ранней стадии и имеют существенные ограничения.
Водяной знак будет незаметно встраиваться в текст с помощью технологии textGrain. Она меняет выбор слов по определенному статистическому принципу, создавая скрытый сигнал. Специальный детектор затем проверяет текст и определяет, есть ли в нем такой водяной знак.
Одновременно OpenAI начнет принимать заявки от исследователей и экспертных организаций на доступ к детектору. На первом этапе пользоваться им смогут только одобренные специалисты, которые помогут компании оценить надежность технологии и варианты ее ответственного применения.
Для API-клиентов текстовая маркировка уже доступна по желанию для отдельных моделей по всему миру, однако по умолчанию она отключена.
При этом OpenAI предупреждает, что водяной знак не позволяет со стопроцентной уверенностью установить происхождение текста. Чем короче материал или чем жестче требования к формулировкам, тем сложнее его обнаружить. Кроме того, редактирование способно существенно ослабить сигнал.
В тестах OpenAI детектор находил водяной знак примерно в 80 % текстов объемом около 200 токенов — то есть примерно 130–160 слов, — и в 95 % материалов объемом около 400 токенов (260–320 слов). Для текстов по математике показатели были значительно ниже из-за меньшей свободы в выборе слов.
Перефразирование также резко снижало эффективность определения. Замена 10 % слов синонимами уменьшала показатель обнаружения с примерно 92 % до 66 %, а при замене четверти слов он падал до 17 %.
OpenAI заявляет, что textGrain в собственных испытаниях показал результаты не хуже или лучше других протестированных подходов, включая SynthID для текста. При этом компания планирует сделать технологию открытой, чтобы другие разработчики могли использовать ее и развивать собственные решения.
Требования ЕС к маркировке ИИ-контента являются частью более широкого подхода к прозрачности использования генеративного искусственного интеллекта. В OpenAI отдельно отметили, что существующие инструменты для проверки происхождения изображений и аудио продолжат оставаться доступными организациям, которые хотят определить, были ли такие материалы созданы ее системами.
Ранее, математик Нью-Йоркского университета Тристан Бакмастер заявил, что OpenAI могла скопировать подход, который он вместе с коллегой Левантом Альпоге разрабатывал почти год для решения "задачи тысячилетия".

Комментарии отсутствуют