Сядаш и питаш
Отваряш ChatGPT, Gemini или друг AI модел — т.нар. LLM — и задаваш въпрос. Отговорът се появява дума по дума. И точно в това „дума по дума“ е целият фокус.
LLM (Large Language Model — „голям езиков модел“) — програмата зад ChatGPT, Gemini и подобните. Прочела е огромна част от интернет и е научила едно-единствено умение: да познава коя дума идва следващата.
Моделът няма готов отговор отникъде. Той го сглобява в момента, дума по дума.
Моделът не чете думи, а числа
Първата изненада: моделът изобщо не вижда букви. Вашето изречение първо се нарязва на парченца, наречени токени — а всяко парченце си има постоянен номер в огромен речник. Дългите думи често се цепят на две.
Токен (от англ. token — „жетон“) — дума с много значения: в крипто света е монета, в програмирането — ключ за достъп. Общото между всички е „малка стандартна единица“. Тук, при езиковите модели, токен означава само едно: парченце текст — цяла дума, част от дума или препинателен знак — със свой постоянен номер в речника на модела. Моделът работи само с номерата.
Вътре в модела всичко е смятане с тези числа. Накрая процесът се обръща: изчислените числа се превръщат обратно в думи — и вие виждате отговор на български. Думите са само за нас.
Всяка дума е избор
За всяка следваща дума моделът пресмята кои са възможните продължения и колко вероятно е всяко. После тегли една — не задължително най-вероятната. Гледайте как се случва:
Морето
Затова един и същи въпрос дава различен отговор всеки път.
Тайният трик: зелен и червен списък
Тук идва водният знак. Преди всяка дума моделът тайно разделя възможните продължения на два списъка — зелен и червен. Разделянето е просто сметка върху номерата на токените от стъпка 2 — затова е светкавично и напълно невидимо в текста. Формулата знае само производителят. После моделът почти винаги избира от зеления списък.
Воден знак — невидим „подпис“ в AI текста. Не е скрит символ или код, а закономерност в самия избор на думите — както водният знак в банкнотата се вижда само срещу светлина, този се вижда само с тайната формула.
Зелен списък
Червен списък
За читателя текстът изглежда напълно нормален. Знакът е невидим — но е там, във всяка дума.
Проверката
Проверяващият знае същата тайна формула. Оцветява всяка дума от текста според списъка, в който попада, и брои зелените. При човек е около половината — чиста случайност. При модел с воден знак — далеч повече.
човек Текст, писан от човек
AI Текст от модел с воден знак
Пример от практиката
Какво прави Google с това
Такава преценка вече се случва всеки ден. Ботът на Google обхожда всяка страница в интернет, а системите му за качество я оценяват. Масово генериран текст без стойност потъва надолу в резултатите — в SERP — а полезното съдържание се изкачва нагоре.
Googlebot — програмата-„паяк“ на Google. Денонощно обикаля интернет от линк на линк и чете страниците, за да знае Google какво има в тях и какво да ви покаже при търсене.
SERP (Search Engine Results Page) — страницата с резултати, която виждате, след като потърсите нещо в Google. Битката на всеки сайт е да е по-нагоре в нея — първите места прибират почти всички кликове.
Уточнение: Google официално наказва не самия AI, а безполезното съдържание. Добре редактиран AI текст с реална стойност може да стои високо — поточно генерираните страници потъват.
Три уговорки
Кога това не работи
Знакът трябва да е вграден. Вижда се само ако производителят на модела го е сложил и пази формулата.
Трябва достатъчно текст. Две изречения не стигат. А преразказан или преведен текст губи знака.
Онлайн „AI детекторите“ са друго нещо. Те просто мерят колко предвидим е текстът и често грешат — включително срещу хора, писали сами. Резултатът им не е доказателство.