EDPB изяснява изискванията на GDPR при web scraping за обучение на AI модели

Общественото обсъждане на насоките е до 30 октомври 2026 г.

Европейският комитет по защита на данните (ЕКЗД/EDPB) публикува проект на насоки, свързани с web scraping в контекста на generative AI.

EDPB пише, че web scraping е мащабен автоматизиран процес на извличане на данни, който често се извършва без знанието на лицата и който може да представлява значителни рискове за защитата на личните им данни.

Generative AI е технология, целяща да създава ново съдържание чрез изучаване на модели от съществуващи данни. Тя използва специализирани модели за машинно обучение, предназначени да генерират широк и общ набор от резултати, като например текст, изображение или аудио.

В своите Насоки 03/2026 относно web scraping в контекста на generative AI комитетът изяснява различни аспекти на съответствието на извличането на данни с ОРЗД/GDPR, включително правното основание за такива дейности и условията, при които специални категории данни могат да бъдат обработвани в този контекст.

GDPR се прилага за web scraping, когато той включва операции по обработка на лични данни, като събиране, съхранение, организиране и извличане.

Когато се разчита на web scraping, е необходимо да се обърне особено внимание на принципа за ограничаване на целта и на принципа за прозрачност. Въпреки това, в зависимост от това как точно е проектирана обработката на данните, администраторът може да не е длъжен да информира лицата лично, ако това се окаже невъзможно или изисква прекомерни усилия.

ЕКЗД препоръчва извличане на данни само от надеждни източници, записване на timestamp и валидиране на данните преди използването им в обучението за ИИ, за да се гарантира спазването на принципа за точност. Насоките също така съветват за мерки, които администраторът трябва да приложи, за да спазва принципа за минимизиране на данните.

Надграждайки становището на ЕКЗД относно моделите с изкуствен интелект, насоките предоставят допълнителни пояснения и примери относно използването на правното основание за легитимен интерес в специфичния контекст на извличането на данни от уеб пространството за обучение по изкуствен интелект.

Накрая, ЕКЗД припомня, че обработването на специални категории лични данни е по принцип забранено. Ако web scraping от мрежата включва такива данни, са необходими както правно основание по чл. 6 от ОРЗД, така и изключение по чл. 9(2) от ОРЗД. ЕКЗД предполага, че решението на Съда по дело GC & Others (C-136/17) може да е от значение за случайно или остатъчно събиране на специални категории лични данни, при условие че администраторът действа в „рамките на своите отговорности, правомощия и възможности“ и прилага подходящи технически и организационни мерки за предотвратяване на събирането и разпространението на такива данни. Комитетът подчертава, че няма общо изключение от изискванията на чл. 9 от ОРЗД и всеки случай трябва да се оценява поотделно, за да се определи дали се прилагат мотивите на Съда.

Насоките са предмет на обществено обсъждане до 30 октомври 2026 г., което предоставя възможност на заинтересованите страни да коментират и да предоставят обратна връзка, пише EDPB.