Към съдържанието
AI съдържание в интернет — езиков модел пише уеб страници в тъмна сървърна зала
Категория: AI Новини

AI съдържание в интернет: 35% от новите страници [2026]

AI съдържание в интернет: Pew Research измери 35% AI текст в новите страници след ChatGPT. Какво показват числата от август 2026 и какво значат за България

ИД
Иван Драганов//13 мин.
𝕏FBLI

Накратко: AI съдържанието в интернет вече има число, а не само усещане. На 20 август 2026 г. Pew Research Center публикува анализ на близо половин милион уеб страници и намери, че в над една трета от страниците, публикувани след появата на ChatGPT, личат признаци за писане или редактиране от езиков модел. Изследването обхваща само страници на английски, но методът и числата казват доста и за това, което четем на български.

Ключови факти: Докладът излиза на 20 август 2026 г. Анализирани са 490 000 страници — по 10 000 от всеки от 49 обхода на Common Crawl между януари 2021 г. и юли 2026 г. В извадката от юли 2026 г. около 10% от всички страници носят осезаеми признаци за AI авторство. Сред страниците с дата след пускането на ChatGPT през ноември 2022 г. делът е 35%. По домейни: 9,35% при .com, 4,59% при .org, 1,03% при .edu и 0,76% при .gov. Дългото тире се среща около два пъти по-често отпреди, а оксфордската запетая — с 63% повече. Само 10-15% от страниците изобщо имат поле с дата на публикуване.


Какво се случи с AI съдържанието в интернет?

AI съдържание в интернет е текст на уеб страница, който е написан изцяло от езиков модел или е минал през модел при редакцията. Дълго време за мащаба му се говореше по усещане. От 20 август 2026 г. вече има преброяване.

Pew Research Center публикува анализа „How Much of the Internet Is Written With AI?" на 20 август 2026 г. Екипът взима случайна извадка от уеб архива на Common Crawl и я пуска през модел за откриване на AI текст.

Резултатът има две числа, които лесно се бъркат. В случайната извадка от юли 2026 г. около 10% от страниците показват осезаеми признаци за AI авторство. Тази извадка обаче включва и стари страници — сайтове от времето, когато инструменти за писане с AI просто не е имало.

Когато анализът се стесни само до страниците с дата на публикуване след ноември 2022 г., когато излиза ChatGPT, делът скача на 35%. Тоест над една трета от новото в мрежата носи следа от машина. TechCrunch описва находката като първата голяма количествена оценка на явлението.

AI съдържание в интернет — 10% от всички страници срещу 35% от новите след ChatGPT
Двете числа на Pew: цялата мрежа срещу само новото в нея

Защо AI съдържанието в интернет е важно точно сега?

AI съдържанието в интернет опира до три неща наведнъж: какво намираме в търсачката, на какво вярваме и върху какво се обучават следващите модели.

Първо, търсенето. Google не забранява текст, писан с AI, но забранява текст, писан за алгоритъма. В официалните указания за полезно съдържание компанията формулира границата през намерението: използването на автоматизация, включително генериране с AI, с основна цел манипулиране на класирането нарушава политиките срещу спам. Инструментът не е проблемът, целта е.

Второ, доверието. Читателят вече не може да приеме по подразбиране, че текстът пред него е минал през човек. Точно затова разпознаването на AI съдържание се превърна в ежедневно умение, а не в занимание за специалисти.

Трето, обучението. Моделите се обучават върху текст от мрежата. Щом една трета от новите страници вече носят машинна следа, следващото поколение модели ще чете все повече собствения си изход. Изследването на Pew дава първата груба мярка за скоростта на този процес.

Как е измерено AI съдържанието в интернет?

AI съдържанието в интернет е измерено върху извадка, със статистически инструменти. Методологията е публикувана отделно. Прочетете я, преди да цитирате числата.

Ето стъпките:

  • Източник на данните. Common Crawl — организация с нестопанска цел, която поддържа отворен архив на мрежата.
  • Извадка. По 10 000 страници на английски от всеки от 49 обхода между януари 2021 г. и юли 2026 г., или общо 490 000 страници.
  • Детектор. Отворен модел на Pangram — editlens_Llama-3.2-3B, който връща оценка между 0 и 1, където 0 е изцяло човешки текст, а 1 — изцяло машинен.
  • Праг. Страница с оценка 0,2 или по-висока се смята за носеща осезаеми признаци за AI авторство или редакция.
  • Кръстосана проверка. Търговският модел Pangram 3.3 е пуснат върху 62 370 страници. Двата модела съвпадат в 96% от случаите, с капа на Коен 0,61.

Има и едно ограничение, което променя четенето на резултата. Само 10-15% от страниците в обхода изобщо имат поле с дата на публикуване. Тоест числото 35% не е изчислено върху всички 490 000 страници, а върху онази част от тях, за която датата е известна.

Ако сметнем грубо, при 10-15% датирани страници говорим за база от порядъка на 49 000 до 73 500 страници. Това напълно стига за статистическа оценка. Оценката обаче остава оценка — разлика, която в новинарските заглавия обикновено изчезва.

Кои сайтове са пълни с AI съдържание в интернет?

AI съдържанието в интернет не е разпределено равномерно. Разликата между типовете домейни е най-ясната находка в целия доклад.

По данните на Pew, осреднени за шест месеца, признаци за AI авторство се откриват при:

  • .com — 9,35%
  • .org — 4,59%
  • .edu — 1,03%
  • .gov — 0,76%

Търговските сайтове показват такива признаци около десет пъти по-често от университетските и държавните. Обяснението е прозаично: там, където писането е разход, а не цел, машината влиза първа. Университетът пише, защото това е работата му; онлайн магазинът пише, защото трябва да го намерят.

За български собственик на сайт това е важната част от доклада. Домейнът .bg не е измерен, но механиката е същата — натискът за повече текст идва от търсачката.

AI съдържание в интернет по домейни — .com срещу .org, .edu и .gov през 2026
Търговската мрежа води с около десет пъти пред .edu и .gov

Как да познаете AI текст по езика му?

Pew измерва и четири езикови белега, които се засилват осезаемо между 2023 и 2026 г. в анализирания корпус:

  • Дългото тире се среща около два пъти по-често.
  • Оксфордската запетая нараства с 63%.
  • Типичните за модели думи — сред тях delve, interplay и testament — са повече от удвоени.
  • Отрицателният паралелизъм („it's not just X, it's Y") е почти утроен, макар да остава рядък като цяло.

Тук идва предупреждението, което Pew поставят изрично: нито един от тези белези сам по себе си не доказва нищо за конкретен текст. Хората също пишат с дълго тире и с оксфордска запетая. Белезите работят като статистика върху стотици хиляди страници. Върху едно изречение не значат нищо.

За български читател има и втора уговорка. И четирите белега са английски. Оксфордската запетая не съществува като въпрос в българската пунктуация, а дългото тире се използва по други правила. Кой е равностойният набор от белези за български текст, все още никой не е измерил.

Затова техническият път остава по-надежден от езиковото усещане — например водният знак на AI текст, който Anthropic вплита в изхода на моделите Claude от август 2026 г.

Какво казват изследователите за AI съдържанието в интернет?

Авторите на доклада са пределно внимателни със собствения си резултат. Анализът е дело на екипа Data Labs на Pew Research Center, с водещ автор Самюъл Бествейтър.

„Моделите за откриване на AI не са безгрешни — понякога погрешно определят документи, писани от хора, като носещи признаци за AI авторство, и обратното." — Самюъл Бествейтър, старши анализатор на данни, Pew Research Center

Ограниченията, които екипът изброява, са три и всяко от тях смекчава заглавието:

  1. Детекторът бърка в двете посоки, особено при страници отпреди широката употреба на AI, където делът на фалшивите положителни резултати е по-висок.
  2. Датата на публикуване липсва при повечето страници, така че числото 35% стъпва върху малка част от извадката.
  3. Методът не различава текст, написан от модел, от текст, само редактиран с модел. А функциите за редакция с AI вече са вградени в Google Docs и Microsoft Word, тоест милиони документи минават през модел, без авторът да мисли за това като за „генериране".

Именно третата уговорка е най-съществената. „Написано от AI" и „минало през AI" са различни неща, а измерването ги слива в едно.

Преди и сега: как се промени AI съдържанието в интернет?

плъзни →
Сравнение: Дял AI страници, Нови страници, Дълго тире, Оксфордска запетая, Думи като delve, Писане с AI
ПоказателПреди ChatGPTЮли 2026
Дял AI странициПрактически нулаОколо 10% от всички страници
Нови странициВъпросът не стои35% с признаци за AI
Дълго тиреБазово нивоОколо два пъти по-често
Оксфордска запетаяБазово нивоС 63% повече
Думи като delveБазово нивоНад два пъти повече
Писане с AIОтделен инструментВградено в Word и Google Docs

Таблицата показва посоката, но не и скоростта. Възходящата тенденция започва в края на 2022 г., когато излиза ChatGPT, и продължава с всеки следващ модел — Claude, Gemini и останалите.

Предимства
  • Писането престава да е спирачка — малък бизнес поддържа сайт на няколко езика без екип
  • Рутинната част от текста (описания, резюмета, отговори на въпроси) излиза за минути
  • Преводът и редакцията поевтиняват, което разширява достъпното съдържание на малки езици
  • За пръв път има число вместо усещане, а методологията е публична и проверима
×Недостатъци
  • ×Търсенето се пълни с текстове, писани за алгоритъм, а не за читател
  • ×Детекторите бъркат в двете посоки и не бива да се ползват като доказателство за конкретен текст
  • ×Числото 35% стъпва само върху страниците с дата, тоест 10-15% от извадката
  • ×Измерен е само английският интернет — за българския няма никакви данни
  • ×Следващите модели ще се обучават върху текст, писан от предишни модели

Как AI съдържанието в интернет засяга България?

AI съдържанието в интернет засяга България по три конкретни линии, макар докладът да не съдържа нито едно българско число.

Първо, измерването липсва. Анализът обхваща страници на английски. За .bg домейните, за българските новинарски сайтове и за онлайн магазините на български няма нито един подобен доклад. Всяко твърдение колко от българската мрежа е писана от AI днес е предположение.

Второ, бизнесът тепърва навлиза. По данни на Eurostat за 2025 г. 20,0% от предприятията в ЕС с десет или повече заети използват AI технологии. В България делът е 8,5% — трети най-нисък в съюза след Румъния (5,2%) и Полша (8,4%), при 42,0% за Дания. Растежът у нас върви стабилно: 3,62% през 2023 г., 6,47% през 2024 г. и 8,55% през 2025 г.

Ако този темп се запази, около два процентни пункта годишно, България ще стигне днешното средно европейско ниво към 2032 г. Това е проста екстраполация, не прогноза на Eurostat — при по-бързо навлизане срокът се скъсява осезаемо. Българският интернет вероятно е в по-ранна фаза от английския, тоест същата вълна тепърва предстои.

Трето, правилата вече важат. От 2 август 2026 г. в целия ЕС, включително у нас, действат правилата за прозрачност от европейския регламент за изкуствен интелект. Те не забраняват писането с AI, но задължават потребителят да бъде уведомен, когато общува със система с изкуствен интелект.

Какво следва за AI съдържанието в интернет?

За AI съдържанието в интернет следващите месеци носят три неща, които вече са факт.

Мерките ще се повтарят. Common Crawl продължава да обхожда мрежата, а моделът на Pangram е с отворени тегла и свободен за нетърговска употреба. Всеки изследователски екип може да повтори анализа върху следващите обходи — и върху друг език.

Google остава на позицията си. Компанията не наказва използването на AI, а липсата на стойност. Указанията за полезно съдържание питат дали читателят си тръгва с чувството, че е научил нещо, не с какъв инструмент е написан текстът.

Прозрачността се разширява. Задълженията по европейския регламент влизат на етапи, а маркирането на машинно генериран текст вече не е доброволна практика при част от големите доставчици.

Едно нещо докладът на Pew не казва и не може да каже: колко от този текст е добър. Делът на AI авторството измерва произход, не качество. Тази преценка още се прави по стария начин — с четене.

Често задавани въпроси за AI съдържанието в интернет

Каква част от интернет е написана с AI през 2026 г.?+
В случайна извадка от юли 2026 г. Pew Research Center открива осезаеми признаци за AI авторство при около 10% от всички уеб страници. Сред страниците, публикувани след пускането на ChatGPT през ноември 2022 г., делът е 35%.
Какво точно означава признак за AI авторство?+
Означава, че моделът за откриване е дал на страницата оценка 0,2 или по-висока по скала от 0 до 1. Това покрива както изцяло генериран текст, така и текст, който е бил само редактиран с AI. Методът не разграничава двете.
Надежден ли е детекторът, който Pew използват?+
Отчасти. При кръстосана проверка върху 62 370 страници отвореният модел съвпада с търговския Pangram 3.3 в 96% от случаите. Самите автори предупреждават, че детекторите бъркат в двете посоки и не бива да се ползват за преценка на отделен документ.
Колко от българския интернет е писан с AI?+
Няма измерване. Анализът на Pew обхваща само страници на английски език. Към август 2026 г. няма публикувано изследване с подобна методология за българската мрежа.
Наказва ли Google съдържанието, писано с AI?+
Не за самото използване на AI. Google определя като нарушение на политиките срещу спам използването на автоматизация с основна цел манипулиране на класирането. Границата минава през намерението и стойността за читателя, не през инструмента.
Как да позная дали един текст е писан от модел?+
По езикови белези не със сигурност. Дългото тире, оксфордската запетая и думи като delve са статистически по-чести при машинен текст, но всеки от тях се среща и при хора. По-надеждни са техническите пътища — воден знак, метаданни и деклариране от издателя.
Защо две различни числа — 10% и 35%?+
Първото е делът сред всички страници в извадката, включително публикуваните преди появата на ChatGPT. Второто е делът само сред страниците с дата след ноември 2022 г. Второто число е по-подходящо за въпроса какво се случва с новото съдържание.

Заключение

Докладът на Pew Research Center от 20 август 2026 г. дава първото сериозно число за нещо, което всички усещаха: над една трета от новите страници в англоезичния интернет носят следа от езиков модел. Числото е оценка, стъпваща върху 10-15% датирани страници, и не различава писане от редакция. Точно затова заслужава внимание без паника.

За България изводът е двоен. Измерване няма, а бизнесът е в по-ранна фаза от европейския — 8,5% срещу 20,0% използване на AI в предприятията за 2025 г. Вълната не подминава малките пазари, просто пристига по-късно. Който днес пише за читателя, а не за алгоритъма, ще спечели и когато българският дял догони английския.

Допълнителни ресурси

Официален сайт:Посетете сайта →
// Споделете
𝕏FBLI
ИД
Иван Драганов

Основател на CyberNinjas.ai и Кибер Хора. Пише за AI инструменти, новини и практически ръководства.

// Свързани

Още статии