AI съдържание в интернет: 35% от новите страници [2026]
AI съдържание в интернет: Pew Research измери 35% AI текст в новите страници след ChatGPT. Какво показват числата от август 2026 и какво значат за България
Накратко: AI съдържанието в интернет вече има число, а не само усещане. На 20 август 2026 г. Pew Research Center публикува анализ на близо половин милион уеб страници и намери, че в над една трета от страниците, публикувани след появата на ChatGPT, личат признаци за писане или редактиране от езиков модел. Изследването обхваща само страници на английски, но методът и числата казват доста и за това, което четем на български.
Ключови факти: Докладът излиза на 20 август 2026 г. Анализирани са 490 000 страници — по 10 000 от всеки от 49 обхода на Common Crawl между януари 2021 г. и юли 2026 г. В извадката от юли 2026 г. около 10% от всички страници носят осезаеми признаци за AI авторство. Сред страниците с дата след пускането на ChatGPT през ноември 2022 г. делът е 35%. По домейни: 9,35% при .com, 4,59% при .org, 1,03% при .edu и 0,76% при .gov. Дългото тире се среща около два пъти по-често отпреди, а оксфордската запетая — с 63% повече. Само 10-15% от страниците изобщо имат поле с дата на публикуване.
Какво се случи с AI съдържанието в интернет?
AI съдържание в интернет е текст на уеб страница, който е написан изцяло от езиков модел или е минал през модел при редакцията. Дълго време за мащаба му се говореше по усещане. От 20 август 2026 г. вече има преброяване.
Pew Research Center публикува анализа „How Much of the Internet Is Written With AI?" на 20 август 2026 г. Екипът взима случайна извадка от уеб архива на Common Crawl и я пуска през модел за откриване на AI текст.
Резултатът има две числа, които лесно се бъркат. В случайната извадка от юли 2026 г. около 10% от страниците показват осезаеми признаци за AI авторство. Тази извадка обаче включва и стари страници — сайтове от времето, когато инструменти за писане с AI просто не е имало.
Когато анализът се стесни само до страниците с дата на публикуване след ноември 2022 г., когато излиза ChatGPT, делът скача на 35%. Тоест над една трета от новото в мрежата носи следа от машина. TechCrunch описва находката като първата голяма количествена оценка на явлението.

Защо AI съдържанието в интернет е важно точно сега?
AI съдържанието в интернет опира до три неща наведнъж: какво намираме в търсачката, на какво вярваме и върху какво се обучават следващите модели.
Първо, търсенето. Google не забранява текст, писан с AI, но забранява текст, писан за алгоритъма. В официалните указания за полезно съдържание компанията формулира границата през намерението: използването на автоматизация, включително генериране с AI, с основна цел манипулиране на класирането нарушава политиките срещу спам. Инструментът не е проблемът, целта е.
Второ, доверието. Читателят вече не може да приеме по подразбиране, че текстът пред него е минал през човек. Точно затова разпознаването на AI съдържание се превърна в ежедневно умение, а не в занимание за специалисти.
Трето, обучението. Моделите се обучават върху текст от мрежата. Щом една трета от новите страници вече носят машинна следа, следващото поколение модели ще чете все повече собствения си изход. Изследването на Pew дава първата груба мярка за скоростта на този процес.
Как е измерено AI съдържанието в интернет?
AI съдържанието в интернет е измерено върху извадка, със статистически инструменти. Методологията е публикувана отделно. Прочетете я, преди да цитирате числата.
Ето стъпките:
- Източник на данните. Common Crawl — организация с нестопанска цел, която поддържа отворен архив на мрежата.
- Извадка. По 10 000 страници на английски от всеки от 49 обхода между януари 2021 г. и юли 2026 г., или общо 490 000 страници.
- Детектор. Отворен модел на Pangram — editlens_Llama-3.2-3B, който връща оценка между 0 и 1, където 0 е изцяло човешки текст, а 1 — изцяло машинен.
- Праг. Страница с оценка 0,2 или по-висока се смята за носеща осезаеми признаци за AI авторство или редакция.
- Кръстосана проверка. Търговският модел Pangram 3.3 е пуснат върху 62 370 страници. Двата модела съвпадат в 96% от случаите, с капа на Коен 0,61.
Има и едно ограничение, което променя четенето на резултата. Само 10-15% от страниците в обхода изобщо имат поле с дата на публикуване. Тоест числото 35% не е изчислено върху всички 490 000 страници, а върху онази част от тях, за която датата е известна.
Ако сметнем грубо, при 10-15% датирани страници говорим за база от порядъка на 49 000 до 73 500 страници. Това напълно стига за статистическа оценка. Оценката обаче остава оценка — разлика, която в новинарските заглавия обикновено изчезва.
Кои сайтове са пълни с AI съдържание в интернет?
AI съдържанието в интернет не е разпределено равномерно. Разликата между типовете домейни е най-ясната находка в целия доклад.
По данните на Pew, осреднени за шест месеца, признаци за AI авторство се откриват при:
- .com — 9,35%
- .org — 4,59%
- .edu — 1,03%
- .gov — 0,76%
Търговските сайтове показват такива признаци около десет пъти по-често от университетските и държавните. Обяснението е прозаично: там, където писането е разход, а не цел, машината влиза първа. Университетът пише, защото това е работата му; онлайн магазинът пише, защото трябва да го намерят.
За български собственик на сайт това е важната част от доклада. Домейнът .bg не е измерен, но механиката е същата — натискът за повече текст идва от търсачката.

Как да познаете AI текст по езика му?
Pew измерва и четири езикови белега, които се засилват осезаемо между 2023 и 2026 г. в анализирания корпус:
- Дългото тире се среща около два пъти по-често.
- Оксфордската запетая нараства с 63%.
- Типичните за модели думи — сред тях
delve,interplayиtestament— са повече от удвоени. - Отрицателният паралелизъм („it's not just X, it's Y") е почти утроен, макар да остава рядък като цяло.
Тук идва предупреждението, което Pew поставят изрично: нито един от тези белези сам по себе си не доказва нищо за конкретен текст. Хората също пишат с дълго тире и с оксфордска запетая. Белезите работят като статистика върху стотици хиляди страници. Върху едно изречение не значат нищо.
За български читател има и втора уговорка. И четирите белега са английски. Оксфордската запетая не съществува като въпрос в българската пунктуация, а дългото тире се използва по други правила. Кой е равностойният набор от белези за български текст, все още никой не е измерил.
Затова техническият път остава по-надежден от езиковото усещане — например водният знак на AI текст, който Anthropic вплита в изхода на моделите Claude от август 2026 г.
Какво казват изследователите за AI съдържанието в интернет?
Авторите на доклада са пределно внимателни със собствения си резултат. Анализът е дело на екипа Data Labs на Pew Research Center, с водещ автор Самюъл Бествейтър.
„Моделите за откриване на AI не са безгрешни — понякога погрешно определят документи, писани от хора, като носещи признаци за AI авторство, и обратното." — Самюъл Бествейтър, старши анализатор на данни, Pew Research Center
Ограниченията, които екипът изброява, са три и всяко от тях смекчава заглавието:
- Детекторът бърка в двете посоки, особено при страници отпреди широката употреба на AI, където делът на фалшивите положителни резултати е по-висок.
- Датата на публикуване липсва при повечето страници, така че числото 35% стъпва върху малка част от извадката.
- Методът не различава текст, написан от модел, от текст, само редактиран с модел. А функциите за редакция с AI вече са вградени в Google Docs и Microsoft Word, тоест милиони документи минават през модел, без авторът да мисли за това като за „генериране".
Именно третата уговорка е най-съществената. „Написано от AI" и „минало през AI" са различни неща, а измерването ги слива в едно.
Преди и сега: как се промени AI съдържанието в интернет?
| Показател | Преди ChatGPT | Юли 2026 |
|---|---|---|
| Дял AI страници | Практически нула | Около 10% от всички страници |
| Нови страници | Въпросът не стои | 35% с признаци за AI |
| Дълго тире | Базово ниво | Около два пъти по-често |
| Оксфордска запетая | Базово ниво | С 63% повече |
| Думи като delve | Базово ниво | Над два пъти повече |
| Писане с AI | Отделен инструмент | Вградено в Word и Google Docs |
Таблицата показва посоката, но не и скоростта. Възходящата тенденция започва в края на 2022 г., когато излиза ChatGPT, и продължава с всеки следващ модел — Claude, Gemini и останалите.
- ✓Писането престава да е спирачка — малък бизнес поддържа сайт на няколко езика без екип
- ✓Рутинната част от текста (описания, резюмета, отговори на въпроси) излиза за минути
- ✓Преводът и редакцията поевтиняват, което разширява достъпното съдържание на малки езици
- ✓За пръв път има число вместо усещане, а методологията е публична и проверима
- ×Търсенето се пълни с текстове, писани за алгоритъм, а не за читател
- ×Детекторите бъркат в двете посоки и не бива да се ползват като доказателство за конкретен текст
- ×Числото 35% стъпва само върху страниците с дата, тоест 10-15% от извадката
- ×Измерен е само английският интернет — за българския няма никакви данни
- ×Следващите модели ще се обучават върху текст, писан от предишни модели
Как AI съдържанието в интернет засяга България?
AI съдържанието в интернет засяга България по три конкретни линии, макар докладът да не съдържа нито едно българско число.
Първо, измерването липсва. Анализът обхваща страници на английски. За .bg домейните, за българските новинарски сайтове и за онлайн магазините на български няма нито един подобен доклад. Всяко твърдение колко от българската мрежа е писана от AI днес е предположение.
Второ, бизнесът тепърва навлиза. По данни на Eurostat за 2025 г. 20,0% от предприятията в ЕС с десет или повече заети използват AI технологии. В България делът е 8,5% — трети най-нисък в съюза след Румъния (5,2%) и Полша (8,4%), при 42,0% за Дания. Растежът у нас върви стабилно: 3,62% през 2023 г., 6,47% през 2024 г. и 8,55% през 2025 г.
Ако този темп се запази, около два процентни пункта годишно, България ще стигне днешното средно европейско ниво към 2032 г. Това е проста екстраполация, не прогноза на Eurostat — при по-бързо навлизане срокът се скъсява осезаемо. Българският интернет вероятно е в по-ранна фаза от английския, тоест същата вълна тепърва предстои.
Трето, правилата вече важат. От 2 август 2026 г. в целия ЕС, включително у нас, действат правилата за прозрачност от европейския регламент за изкуствен интелект. Те не забраняват писането с AI, но задължават потребителят да бъде уведомен, когато общува със система с изкуствен интелект.
Какво следва за AI съдържанието в интернет?
За AI съдържанието в интернет следващите месеци носят три неща, които вече са факт.
Мерките ще се повтарят. Common Crawl продължава да обхожда мрежата, а моделът на Pangram е с отворени тегла и свободен за нетърговска употреба. Всеки изследователски екип може да повтори анализа върху следващите обходи — и върху друг език.
Google остава на позицията си. Компанията не наказва използването на AI, а липсата на стойност. Указанията за полезно съдържание питат дали читателят си тръгва с чувството, че е научил нещо, не с какъв инструмент е написан текстът.
Прозрачността се разширява. Задълженията по европейския регламент влизат на етапи, а маркирането на машинно генериран текст вече не е доброволна практика при част от големите доставчици.
Едно нещо докладът на Pew не казва и не може да каже: колко от този текст е добър. Делът на AI авторството измерва произход, не качество. Тази преценка още се прави по стария начин — с четене.
Често задавани въпроси за AI съдържанието в интернет
Каква част от интернет е написана с AI през 2026 г.?+
Какво точно означава признак за AI авторство?+
Надежден ли е детекторът, който Pew използват?+
Колко от българския интернет е писан с AI?+
Наказва ли Google съдържанието, писано с AI?+
Как да позная дали един текст е писан от модел?+
Защо две различни числа — 10% и 35%?+
Заключение
Докладът на Pew Research Center от 20 август 2026 г. дава първото сериозно число за нещо, което всички усещаха: над една трета от новите страници в англоезичния интернет носят следа от езиков модел. Числото е оценка, стъпваща върху 10-15% датирани страници, и не различава писане от редакция. Точно затова заслужава внимание без паника.
За България изводът е двоен. Измерване няма, а бизнесът е в по-ранна фаза от европейския — 8,5% срещу 20,0% използване на AI в предприятията за 2025 г. Вълната не подминава малките пазари, просто пристига по-късно. Който днес пише за читателя, а не за алгоритъма, ще спечели и когато българският дял догони английския.
Допълнителни ресурси
- How Much of the Internet Is Written With AI? — Pew Research Center
- Методология на изследването — Pew Research Center
- editlens_Llama-3.2-3B — отвореният детектор на Pangram
- Създаване на полезно съдържание — Google Search Central
- Използване на AI в предприятията в ЕС — Eurostat
- Разпознаване на AI съдържание: дийпфейк гайд
- Воден знак на AI текст: Claude маркира всичко
Основател на CyberNinjas.ai и Кибер Хора. Пише за AI инструменти, новини и практически ръководства.
Още статии

ChatGPT за тийнейджъри: как работят новите защити [2026]
ChatGPT за тийнейджъри тръгна на 18 август 2026 г. Как OpenAI разпознава непълнолетните, какво точно ограничава и какво реално могат родителите в България

AI кибератаки: OpenAI спря обучението на Astra [2026]
AI кибератаки вече не са теория: модел на OpenAI проби Hugging Face за 4,5 дни, а Astra доближи критичното ниво. Какво спря OpenAI през август 2026 и защо

Воден знак на AI текст: Claude маркира всичко [2026]
Воден знак на AI текст: Anthropic маркира всичко, което Claude пише от август 2026. Как работи, кой може да го провери и какво се променя за нас в България
