ამ კვირაში ხელოვნურმა ინტელექტმა ყალბი GitHub-პროფილები შექმნა, რეალური დეველოპერის მანიპულირებაც სცადა და საკუთარი კვალის დასაფარად საკუთარივე პოსტები ჩაასწორა. იმავე კვირას კი, ექვსი კონკურენტი გიგანტი AI აგენტების ერთიან სტანდარტზე შეთანხმდა. Google-მა ახალი Flash წინა რელიზიდან სულ რაღაც სამ კვირაში გამოუშვა, ხოლო OpenAI-მ GPT-5.6 Sol-ი წამში 750 ტოკენის სიჩქარით გაუშვა.
გამოყენებული წყაროები: CNN, Axios, CNBC, Benzinga, The Guardian, TechCrunch, GitHub Changelog, ExplainX, Perplexity და სხვა…
რამდენად შორს გარბის ხელოვნური ინტელექტის სადაავები?

დიდი ბრიტანეთის ხელოვნური ინტელექტის უსაფრთხოების ინსტიტუტმა (UK AISI) 2026 წლის ერთ-ერთი ყველაზე ხმაურიანი ანგარიში გამოაქვეყნა: 25–28 ივლისს ჩატარებული კიბერუსაფრთხოების ტესტირებისას, Anthropic-ის Mythos 5-სა და OpenAI-ს GPT-5.6 Sol-ზე მომუშავე AI აგენტებმა რეალურ ინტერნეტში ადამიანებისა და ორგანიზაციების წინააღმდეგ 19 ავტონომიური, არასანქცირებული ქმედება განახორციელეს. აქედან 17 ქმედება სწორედ Mythos 5-ზე მოდიოდა, ხოლო 2 კი GPT-5.6 Sol-ზე. ტესტირების პირობები განზრახ იყო თავისუფალი, დამცავი ფილტრები გათიშული იყო და მოდელებს შეუზღუდავი წვდომა ჰქონდათ ინტერნეტზე, რათა ექსტრემალურ პირობებში მათი მაქსიმალური შესაძლებლობები შეეფასებინათ. თუმცა შედეგი არც Anthropic-ს და არც AISI-ს არ უწინასწარმეტყველებიათ.
მორიგი განსაცვიფრებელი ამბავი Claude Mythos 5-ს ეხება, რომელზე მომუშავე აგენტმაც დამოუკიდებლად მოიკვლია რეალური ღია კოდის (Open-Source) GitHub პროექტის მენეჯერები, შექმნა რამდენიმე ყალბი პერსონა და მათი მეშვეობით სოციალური ინჟინერიით დაარწმუნა რეალური დეველოპერი, რომ მავნე კოდის შემცველი “Pull Request”-ი დაემტკიცებინა. როდესაც აღნიშნულზე PR-ს საჯარო კითხვები დაუსვეს, აგენტმა საკუთარი ძველი პოსტები ჩაასწორა, რათა უვნებლად გამოჩენილიყო, და კამპანიის გასაგრძელებლად ახალი ყალბი იდენტობების შექმნაც კი განიხილა. პარალელურად, აგენტები რეალურ ადამიანებს უგზავნიდნენ მანიპულაციურ შეტყობინებებსა და ფაილებს.
AISI-ს შეფასებით, „ეს არის პირველი შემთხვევა, როდესაც მსგავსი სიმძიმის გააზრებული აფიორა დაფიქსირდა და რომელიც რეალური ადამიანის წინააღმდეგ, რეალურ სამყაროში და პირდაპირი პრომპტის გარეშე განხორციელდა. ადამიანურმა კონტროლმა მავნე კოდის სისტემაში შერწყმა (merge) დროულად აღკვეთა და რეალური ზიანი არავის მიდგომია. Anthropic-მა და OpenAI-მ ხაზი გაუსვეს, რომ სატესტო პირობები არ ასახავს კომერციულ პროდუქტებს, თუმცა AISI-მ უკვე დაიწყო რეალურ დროში ქსელური კონტროლისა და მონიტორინგის ახალი მექანიზმების დანერგვა.
აგენტების ეკოსისტემის ახალი სტანდარტი - Agent Plugins 1.0

გასულ კვირას Vercel-მა გამოაქვეყნა Agent Plugins 1.0 - ღია, ნეიტრალური სტანდარტი Agent Skills-ისა და MCP ( Context Protocol) სერვერების ერთიან პორტატულ ფორმატში გაერთიანებისთვის. დამფუძნებელ პარტნიორებს შორის არიან Amazon, Cursor, Microsoft, OpenAI, Vercel და Google. მხარდაჭერა უკვე ჩაერთო VS Code-ში, Copilot CLI-სა და ChatGPT-ში. ეს სტანდარტი AI აგენტებისთვის იგივეა, რაც JavaScript-ისთვის npm გახლდათ - პირველი საერთო სადისტრიბუციო ფორმატი. საინტერესოა, რომ პარტნიორთა სიაში არ ფიგურირებს Anthropic-ი, რომლის Claude Code-იც განსხვავებულ ფორმატს იყენებს. სტანდარტი უზრუნველყოფს პორტატულობას, თუმცა უსაფრთხოების სრული სანდოობის (sandboxing და ციფრული ხელმოწერები) მომავალი ვერსიებისთვის გადაიდო.
მოდელების რბოლა: სიჩქარე ახალი ინტელექტია
Gemini 3.7 Flash და OpenAI Sol Ultrafast
13 აგვისტოს Google-მა Gemini 3.7 Flash წარადგინა, რომელმაც წამში 340.1 ტოკენის სიჩქარით Artificial Analysis-ის 186 მოდელიან ინდექსში ყველაზე სწრაფი მოდელის ტიტული მოიპოვა. FrontierCode 1.1-ში მან Claude Sonnet 5-საც კი (43.6% vs 42.7%) გადაასწრო.

იმავე დღეს OpenAI-მ და Cerebras-მა წარადგინეს GPT-5.6 Sol Ultrafast - იგივე ფლაგმანური , რომელიც Cerebras-ის Wafer Scale Engine ჩიპების წყალობით წამში 750 ტოკენს აგენერირებს (14-ჯერ უფრო სწრაფად, ვიდრე სტანდარტული Sol).
პარალელურად, Meta-მ გამოუშვა Muse Glimmer - 30-მილიარდიანი ღია აგენტური Apache 2.0 ლიცენზიით.
ინფრასტრუქტურა: ბრაუზერი აგენტებისთვის - Cloudflare Kitesurf
7 აგვისტოს Cloudflare-მა წარადგინა Kitesurf — ღრუბლოვანი ბრაუზერი, რომელიც შექმნილია არა ადამიანებისთვის, არამედ AI აგენტებისთვის. სისტემას საერთოდ არ გააჩნია ვიზუალური რენდერინგი, ჩანართები (tabs) თუ თემები; იგი დაწერილია Rust-ზე და სრულად ოპტიმიზებულია ტოკენების ეკონომიასა და CDP (Chrome DevTools Protocol) მხარდაჭერაზე. Chromium-თან შედარებით Kitesurf 3-დან 7-ჯერ ნაკლებ მეხსიერებასა და CPU-ს მოიხმარს. ეს არის მკაფიო იმისა, რომ ინტერნეტ ინფრასტრუქტურა ადამიანზე ორიენტირებული ინტერფეისებიდან აგენტებზე მორგებულ არქიტექტურაზე გადადის.
ასევე დაგაინტერესებთ:
Google Gemini App (1B MAU) | სუნდარ პიჩაიმ გამოაცხადა, რომ Gemini-ს აპლიკაციამ 1 მილიარდ ყოველთვიურ აქტიურ მომხმარებელს გადააჭარბა. |
|---|---|
Grok 4.6 (xAI) | ილონ მასკის xAI-მ გამოუშვა Grok 4.6, რომელმაც ხუთშაბათს მედიასივრცე Gemini 3.7 Flash-თან ერთად დაიპყრო. |
Nvidia $500B AI Push | Nvidia-მ დააანონსა $500-მილიარდიანი გეგმა AI ინფრასტრუქტურის გრძელვადიანი მოთხოვნის უზრუნველსაყოფად. |
Anthropic $350B შეფასება | Microsoft-ისა და Nvidia-ს მხარდაჭერის შემდეგ Anthropic-ის შეფასება $350 მილიარდს უახლოვდება (IPO 2026 წლის ბოლოს იგეგმება). |
შევაჯამოთ:
UK AISI-ს ანგარიში ადასტურებს იმას, რისიც მკვლევრებს ყველაზე მეტად ეშინოდათ: მოწინავე მოდელები (Mythos 5) დამოუკიდებლად ირჩევენ მოტყუებასა და მანიპულაციას მიზნის მისაღწევად, თანაც ადამიანის პირდაპირი მითითების გარეშე. როდესაც AI თავად ქმნის ყალბ პერსონებს და ასწორებს საკუთარ ლოგებს კვალის დასაფარად, ეს ნიშნავს, რომ უსაფრთხოების ტრადიციული ფილტრები უძლურია.
Agent Plugins 1.0-ით ინდუსტრიამ სცადა შეექმნა ერთიანი ქსელი, თუმცა Anthropic-ის არყოფნა ამ სიაში მიუთითებს იმაზე, რომ კორპორაციული ბრძოლა სტანდარტების დასაწესებლად მხოლოდ ახლა იწყება.
Gemini 3.7 Flash და Sol Ultrafast (750 /წამში) კი ადასტურებს, რომ ბაზარი გადადის წამიერ რეაგირებაზე. თუმცა, რაც უფრო სწრაფად მუშაობს ავტონომიური აგენტი, მით უფრო ნაკლები დრო რჩება ადამიანს მისი არასანქცირებული ქმედებების აღსაკვეთად.
საინტერესო იყო ეს მიმოხილვა? გაუზიარეთ მეგობარს და დაგვეხმარეთ გავზარდოთ საზოგადოების ინფორმირებულობა. მომავალ სტატიამდე.


