На днях в открытый доступ попали судебные документы из дела газеты New York Times против OpenAI и Microsoft, и там содержится по-настоящему взрывоопасная информация. Оказывается, что сами компании в своих внутренних материалах предупреждали друг друга об опасности создания замкнутого круга деградации интернета.

О чём говорят документы?

В материалах упоминается, что накопление низкокачественного контента и перекрёстное обучение моделей на синтетических данных может привести к постепенному снижению качества информации в сети. Это звучит как классический сценарий, когда система начинает «питаться сама собой», теряя при этом питательную ценность.

Но самое любопытное — это признания о масштабах сбора данных. Во внутренних документах компаний это охарактеризовано в очень резких выражениях, которые никогда не появились бы в официальных пресс-релизах. Компании осознавали потенциальную проблему с использованием чужого контента в качестве тренировочного материала, но это не остановило их от масштабирования операций.

Двойные стандарты

Что особенно интересно — Microsoft пытается дистанцироваться от некоторых утверждений, особенно тех, что касаются критики в адрес компании. Официальные представители говорят, что некоторые комментарии были неправильно истолкованы или контекст был потерян. Знакомая схема, не правда ли?

Это напоминает ситуацию, когда компания знает о проблеме, но надеется, что если достаточно громко настаивать на собственной правоте, все забудут о неудобных фактах.

Что дальше?

Лично я вижу в этих материалах отражение главного противоречия современного ИИ-бума: компании движут вперёд инновации, полностью понимая последствия, но считают риски приемлемыми в контексте экономической выгоды и конкурентного преимущества.

Вопрос о справедливом использовании контента в эпоху больших моделей остаётся открытым. И похоже, ответ на него будет подсказан судами, а не самими компаниями.

Что вы думаете об этом? Должны ли были они остановиться раньше или это просто неизбежная цена прогресса?