По-отворена и автономна наблюдаемост: новият стандарт в бизнеса

  • OpenTelemetry консолидира общ език за телеметрия, който освобождава от обвързване с доставчик и улеснява интегрирането на изкуствен интелект в наблюдаемостта.
  • Наблюдаемостта престава да бъде просто оперативна и сега се свързва с бизнес показатели, потребителско изживяване и реално икономическо въздействие.
  • Наблюдаемостта на агентите задвижва агенти с изкуствен интелект, които откриват, анализират и отстраняват проблеми с нарастваща автономност, подкрепени от надеждни данни.
  • Сигурността, управлението и нулевото доверие стават от съществено значение за контролирането на разширяването на агентния изкуствен интелект и автономните системи в критични среди.

по-отворена и автономна наблюдаемост

La Наблюдаемостта се превърна от нишова техническа тема в стратегически стълб За всяка организация, която разчита на софтуер – каквито са практически всички – простото „мониторинг на сървъри“ или разглеждане на изолирани табла за управление вече не е достатъчно. Компаниите трябва да разбират какво се случва в техните системи в реално време, да свързват тези данни с бизнеса и да реагират бързо, когато нещо се обърка. И на всичкото отгоре, те трябва да го правят във все по-софтуерно ориентирана среда. Агентски изкуствен интелект, отворени стандарти и разпределени архитектури.

В този сценарий тенденцията е очевидна към по-открита наблюдаемост, по-тясно свързана с бизнес резултатите и много по-автономнаOpenTelemetry се утвърждава като общ език за телеметрия, изкуственият интелект излиза отвъд експериментирането, за да се интегрира в ядрото на платформите за наблюдение, а екипите на ITops се трансформират в оркестратори на интелигентни системи, които сами откриват, анализират и дори коригират проблеми. Нека разгледаме как се случва тази промяна и какви са последиците от нея за технологиите, бизнеса, сигурността и управлението на данните.

От класическия мониторинг до ерата на наблюдаемостта

Еволюцията от традиционно наблюдение към съвременна наблюдаемост Това датира отдавна. Когато се появиха пионерски инструменти за APM, като тези, популяризирани от Lew Cirne с New Relic, голямата новина беше възможността да се види подробно какво прави кодът на монолитно приложение в център за данни, собственост на компанията. Това беше революция: за първи път екипите можеха да наблюдават производителността на своите производствени приложения с много фина гранулираност.

С пристигането на облачни изчисления, микросървиси, контейнери, безсървърни изчисления и практики за DevOps и SREПейзажът се промени напълно. Преминаването от монолитни към разпределени системи означаваше, че видимостта в даден момент вече не е достатъчна. Услугата вече не е едно-единствено приложение, а рояк от ефимерни микросървиси, оркестрирани на платформи като Kubernetes, внедрявани десетки пъти на ден и работещи на хибридни инфраструктури с множество доставчици на облачни услуги.

В тази среда традиционното наблюдение, фокусирано върху предварително зададени показатели и статични предупреждения, е недостатъчно. Наблюдаемостта въвежда различен подход: събиране и съпоставяне на показатели, лог файлове, следи и събития да се изведе вътрешното състояние на системата от нейните външни изходи. Не става въпрос само за това да се знае, че нещо се е повредило, а за това да се разбере защо се е случило и какво е въздействието му върху потребителя и бизнеса.

Автори харесват Юрий Шкуро Тази разлика е добре обобщена: мониторингът измерва това, което е било предварително решено като важно, докато наблюдаемостта ви позволява да формулирате нови въпроси относно системата, без да сте подготвили предварително всички показатели. С други думи, Наблюдаемостта превръща телеметричните данни в приложим контекст за развитие, операции и бизнес.

Този преход е обусловен и от много специфични фактори: a брутален натиск за бързи иновацииВсе по-взискателни клиенти, които изоставят приложение при най-малкия недостатък, почти безкраен набор от технологии и управлявани услуги и нарастващ автоматизация на целия жизнен цикъл на софтуераЦялата тази автоматизация е и софтуер, който може да се провали и се нуждае от собствена наблюдаемост.

Сложност, риск и твърде много инструменти: защо наблюдаемостта е критична

тенденции на наблюдаемост

Съвременната архитектура налага четири основни главоболия, които правят наблюдаемостта е практически задължителна Ако искате да запазите контрол:

Първо, сложността се е увеличила драстичноЕдин контейнер може да съществува минути или секунди, една микросървис може да променя версиите си няколко пъти на ден, а компонентите се умножават. Това, което някога е било монолитно приложение, се превръща в съзвездие от взаимосвързани услуги. Оперативните екипи се оказват в ситуация, в която постоянно се справят със стотици или хиляди постоянно променящи се обекти, много от които не са разработили сами.

В допълнение към това явно увеличение на рискаВнедряването няколко пъти на ден означава непрекъснато въвеждане на промени – и потенциални отмени. Гъвкавите практики и непрекъснатата доставка добавят още инструменти, канали и автоматизации, които също трябва да бъдат взети предвид. Способността за бързо откриване на проблем, идентифициране на първопричината и възстановяване или отстраняването му за минути вече не е желателна, а изискване.

Успоредно с това, a пропуск в умениятаТехнологичният стек е толкова обширен, че е невъзможно един човек да овладее бази данни, мрежи, API, сигурност, контейнери, платформи за оркестрация и инструменти за CI/CD. Необходими са механизми, които да помогнат да се разбере как всичко се вписва, какво зависи от какво и къде да се търси, когато нещо се обърка. Без този свързан поглед, времето, загубено при прескачане между инструменти, може да бъде огромно.

И на всичкото отгоре възникват проблеми с „разпръскване на инструменти“ или излишък от инструментиВсеки слой от стека обикновено има свое собствено решение за мониторинг: едно за базата данни, друго за инфраструктурата, друго за фронт-енда, друго за лог файлове, друго за трасирания... Съпоставянето на данни между тях включва непрекъснато превключване на контекста, ръчно търсене и по-дълго време за разрешаване на инциденти. Това е точно обратното на необходимото, когато приложението не работи и потребителите се оплакват.

Отговорът на всичко това се крие в унифицирана платформа за наблюдение която събира цялата съответна телеметрия, свързва я с обектите, които я генерират, и позволява на всеки екип – разработка, операции, сигурност, бизнес – да изследва и използва тези данни от едно място. Това включва не само показатели за производителност, но и бизнес събития и сигнали, които разкриват икономическото въздействие на всеки инцидент.

OpenTelemetry като общ език за наблюдаемост

Една от най-ясните тенденции е консолидирането на OpenTelemetry (OTel) като отворен телеметричен стандартТова е рамка с отворен код, която дефинира API, SDK и компоненти за събиране на показатели, регистрационни файлове и следи по хомогенен начин, без да е обвързана с конкретен производител на инструменти за наблюдение.

През следващите години се очаква Компаниите изискват съвместимост с OpenTelemetry към своите доставчици. Причината е проста: чрез използване на „универсален език“ за описание на телеметрията, организацията може да сменя платформите за наблюдение, без да се налага да пренаписва или преинструментира целия си код. Това намалява риска от обвързване с конкретен доставчик и осигурява гъвкавост за развитие на стека според нуждите.

За разлика от изцяло собствените решения, където всяка нова интеграция зависи от пътната карта на производителя, OTel Това позволява на интеграциите да оцелеят въпреки технологичните промени.С появата на нови облачни услуги, рамки или среди за изпълнение, те просто трябва да излъчват телеметрия в стандартния формат, за да могат да я изпращат до всеки съвместим бекенд.

Освен това, използването на OpenTelemetry е ключово за правилно захранване на изкуствения интелектМоделите с изкуствен интелект, независимо дали става въпрос за традиционно машинно обучение, откриване на аномалии или генеративен изкуствен интелект, работят най-добре, когато данните са чисти, структурирани и последователни. OTel предоставя точно тази унифицирана рамка за генериране и етикетиране на телеметрията, която алгоритмите след това ще обработват.

Последните проучвания показват, че организации, които вече използват OpenTelemetryДори и само частично внедрени, те отчитат положително въздействие върху показатели като ръст на приходите, подобрени оперативни маржове и репутация на марката. Не е магия: наличието на последователна и преносима база за наблюдение улеснява откриването на проблеми, преди да засегнат клиента, и оптимизира производителността на ключови услуги.

Трите стълба на съвременната практика за наблюдение

Освен приемането на стандарт като OTel, добрата практика за наблюдаемост разчита на три основни компонента, които се подсилват взаимноотворена апаратура, свързани обекти (или данни) и програмируемост.

La отворена апаратура Това включва събиране на телеметрия както от собствени, така и от агенти с отворен код. Приложения, услуги, хостове, контейнери, безсървърни функции, мобилни приложения, управлявани облачни услуги – всичко трябва да може да излъчва показатели, събития, регистрационни файлове и следи във формати, които могат да бъдат стандартизирани. Тук се намесват агенти от традиционни доставчици, но също така и експортери и библиотеки от OpenTelemetry и други проекти с отворен код.

Вторият блок е този на свързани обекти и метаданниПростото натрупване на показатели и лог файлове не е достатъчно; трябва да разберете кой ги генерира и как са свързани помежду си. Това изисква идентифициране на услуги, бази данни, опашки, функции, pod-ове, клъстери, облачни акаунти и свързване на тяхната телеметрия и зависимости. В този контекст платформата може автоматично да рендира архитектурни карти, потоци от повиквания и времеви рамки на инциденти, без екипът да се налага да конфигурира всичко ръчно.

Въз основа на това може да се кандидатства интелигентност и усъвършенствани анализиЧрез идентифициране на модели, аномалии и корелации в набора от данни, платформите за наблюдаемост могат да помогнат за приоритизиране на предупрежденията, намаляване на шума, откриване на сложни инциденти и ускоряване на анализа на първопричините. Това е естественият път към все по-проактивна наблюдаемост и, както ще видим по-късно, към агентна автономност.

И накрая има програмируемостВсеки бизнес има специфични нужди: свои собствени ключови показатели за ефективност (KPI), различни критични процеси и уникални модели на разходите. Една съвременна платформа за наблюдение трябва да позволява изграждането на персонализирани приложения и изгледи върху цялата телеметрия: табла за управление, които съчетават технически данни с бизнес показатели, анализ на икономическото въздействие на прекъсвания или влошавания, или вътрешни приложения за разследване на сложни инциденти според работния процес на компанията.

Тази способност за „програмиране“ върху данни за наблюдаемост отваря вратата за случаи на употреба като определете реалната цена на грешката В процес на плащане, свържете го с техническата причина (например, регресия в микроуслуга за плащане) и по този начин приоритизирайте усилията за корекция с чисто икономически критерии за въздействие.

Бизнес-ориентирана наблюдаемост: от конзолата до резултата

Една от очакваните основни трансформации е преминаването от едно наблюдаемост, фокусирана върху техническата операция към друга, ясно ориентирана към бизнеса. Същите данни – регистрационни файлове, трасирания, показатели, събития – започват да се използват не само за поддръжка на инфраструктурата, но и за отговорете на ключови въпроси относно приходите, разходите и потребителското изживяване.

В индустриалните сектори, например, наблюдаемостта на IoT сензорите позволява предвиждане на повреди в машините и оптимизиране на плановете за поддръжка. Ако се открият необичайни вибрации или температури извън допустимите граници, може да се планира интервенция преди спиране на производствената линия, предотвратявайки непланирани престои и техните икономически последици.

Във финансовия сектор, анализирайки в реално време регистрационни файлове на транзакции Това помага за идентифициране на подозрителни транзакции, които биха могли да бъдат свързани с измама. Когато системата открие нетипични последователности от събития, необичайни геолокации или суми, които нарушават обичайните модели, тя може да задейства автоматични механизми за блокиране или ръчен преглед, преди атаката да е успешна.

В маркетинга и продажбите, съпоставянето на проследявания на приложения с показатели за кампанията Това ви позволява да отговорите на много директни въпроси: Влияе ли латентността на уебсайта върху процента на кликване или конверсията? Коя версия на функцията най-добре подобрява навигацията и времето на престой? Ако производителността спадне по време на кампания, наблюдаемостта помага да се определи колко потенциални продажби са загубени и в кой точно момент от фунията е възникнал проблемът.

Всичко това включва преобразуване на техническата телеметрия в практически знания за бизнес лидериНе става въпрос за показване на графика на процесора на търговския директор, а за това да му се покаже колко транзакции не са успели да бъдат завършени поради влошаване на услугата и каква е била прогнозната цена. И за да се постигне това, наблюдаемостта трябва да свързва технически данни, потребителски събития и бизнес показатели в рамките на един и същ модел.

Консултантски фирми, специализирани в наблюдаемостта, като например Nettaro, вече помагат на компании и институции да... да се направи този скок от чисто оперативна към стратегическа визияпроектиране на модели, които свързват бизнес KPI с телеметрични сигнали в реално време.

От AIOps до наблюдаемост на агентите

Осиновяването на Изкуствен интелект в платформи за наблюдение Това вече е реалност. Повечето ITOps екипи са включили AIOps компоненти – алгоритми, които анализират големи обеми от оперативни данни, за да откриват аномалии, да групират събития или да предвиждат проблеми – в своите работни процеси.

В много случаи то също се интегрира Генеративен AI да взаимодействате с телеметрията, използвайки естествен език: задавайте разговорни въпроси като „защо 500 грешки се увеличиха в Европа преди 20 минути?“ и получете обяснение въз основа на лог файлове, показатели и следи, без да е необходимо да изграждате сложни заявки.

Днес обаче повечето решения се основават на изкуствен интелект. Те продължават да бъдат преглеждани от хораАлгоритмите помагат за филтриране на шума и идентифициране на потенциални причини, но оперативните екипи поддържат контрол, валидират препоръките и ръчно изпълняват много действия за отстраняване. Пълното доверие в автоматизираните решения все още е ограничено.

Това е мястото, където Наблюдаемост на агентаТова е подход, при който агентите с изкуствен интелект поемат много по-автономна роля: те не само откриват модели и обясняват какво се случва, но и... Те управляват цялостни работни процеси, от идентифициране на повредата до прилагане на подходящо решение.

В този модел, агент може например да открие аномално увеличение на латентността на критична услуга, да го съпостави с конкретно внедряване, да провери историята на подобни инциденти и сам да реши дали стартиране на връщане към предишна версия, мащабиране на капацитет или прилагане на алтернативна конфигурацияВсичко това се документира подробно за одит и евентуална последваща проверка от човек.

В момента само малка част от компаниите използват това Наблюдаемост на активния агентс автоматизирано отстраняване на проблеми и усъвършенствано прогнозиране на проблеми. Но прогнозите показват, че неговото приемане ще нарасне значително, водено от търсенето на по-голяма производителност в ИТ екипите и необходимостта от намаляване на времето, което те прекарват в повтарящи се задачи по поддръжка.

Ограничения на ръчния надзор и необходимостта от автономност

Търсенето на самонаети агенти се разбира по-добре, ако разгледаме екстремни случаи, като например наблюдаемост на модела на голям език (LLM)Ръчното наблюдение на тези типове системи е почти невъзможна задача: обемите от данни са гигантски, архитектурите комбинират множество разпределени компоненти и необходимостта от наблюдение в реално време е постоянна.

Изобилието от записи и показатели го прави Ръчното идентифициране на проблеми е много бавноВсяко забавяне при откриването на промяна в поведението, увеличаване на грешките или влошаване на качеството на отговорите може да има сериозни последици в производствената среда, както по отношение на потребителското изживяване, така и на репутацията и съответствието с регулаторните изисквания.

Освен това, ръчното наблюдение консумира много човешки ресурси; склонен към грешки и не се мащабира добре С нарастването на броя на моделите, инстанциите или интеграциите с бизнес приложения, това, което може да работи в пилотен проект с няколко потребители, се превръща в пречка, когато системата се внедри в цялата организация.

Следователно, в сложни среди, като тези, включващи LLM или силно разпределени архитектури, необходимостта от автономни решения за наблюдаемостГоворим за системи, способни непрекъснато да анализират телеметрията, да откриват отклонения, да предлагат или изпълняват коригиращи действия и да се учат от всяка интервенция, за да подобрят ефективността си с течение на времето.

Агенти за визуално действие и автоматизация на интерфейси

Развитието на изкуствения интелект не се ограничава до сферата на „класическата“ наблюдаемост. Изследвания от компании като NVIDIA, с проекти като Азот Това са модели, които съчетават визуални и действени възможности: агенти, които наблюдават екран, правят изводи за състоянието на средата и решават какво да правят по-нататък, без специфични интеграции със системата, която контролират.

Технически това включва обучение на модел с големи корпуси от видеоклипове на игри или взаимодействия така че да се научат да свързват това, което виждат, с действията, които би предприел експерт. Те работят върху времеви последователности, дискретизация на движението, дългосрочни цели и оптимизация при множество ограничения, като латентност или стабилност.

Въпреки че най-видимият пример са игрите, този подход, основан на визия и действие, има огромен потенциал в бизнеса: той позволява създаването на агенти, работещи с графични интерфейси конвенционални, навигиране в сложни приложения, изпълнение на повтарящи се потоци, валидиране на процеси или извършване на цялостни тестове без необходимост от специфични API.

Това представлява един вид естествена еволюция на традиционните RPA към По-интелигентна, по-контекстуална автоматизацияТипичните случаи на употреба включват автоматизирано тестване на софтуер, което симулира реално потребителско поведение, насочвана поддръжка, която възпроизвежда кликване по кликване какво трябва да прави служителят, генериране на синтетични данни за QA или „цифрови близнаци“, които възпроизвеждат човешката дейност в корпоративните системи.

За да бъде всичко това жизнеспособно, a стабилна рамка за киберсигурност, управление и наблюдаемостАгентите, взаимодействащи с критични интерфейси и системи, трябва да спазват политиките за достъп, да избягват опасни действия, да регистрират всяка стъпка за целите на одита и да работят в рамките на ясно определени граници. Наблюдаемостта тук действа едновременно като „черна кутия“ и „кутия с инструменти“: тя записва какво прави агентът и предоставя данни за калибриране и подобряване на поведението му.

Сигурност, управление и нулево доверие в ерата на агентите с изкуствен интелект

Разширяването на агентния изкуствен интелект и автономните системи носи със себе си Нови рискове, които трябва да се управляват внимателноЕдин от най-обсъжданите е така нареченият „скрит изкуствен интелект“: агенти, модели или интеграции, които се стартират извън официалните канали на организацията, без адекватен контрол за сигурност или съответствие с регулаторните изисквания.

Съществува и опасност от двойни агенти или злонамерени агентиТова може да се случи или по проект (външни атаки, манипулация на промпт, инжектиране на инструкции), или поради конфигурационни грешки, които позволяват на добронамерена система да извършва непредвидени действия. За да се сведат до минимум тези рискове, е важно да се прилагат принципите на Нулево доверие, по-специално по отношение на изкуствения интелект.

Нулево доверие в този контекст означава, че Никой агент или компонент на ИИ не се счита за „надежден“ по подразбиране.Всяко действие трябва да бъде изрично разрешено, разрешенията трябва да бъдат ограничени до необходимия минимум (принцип на най-малките привилегии) ​​и всички взаимодействия трябва да бъдат регистрирани за по-късен одит. По този начин наблюдаемостта се превръща в ключов елемент от управлението на ИИ.

Добрата наблюдаемост позволява наблюдение в реално време на действията на агентите, откриване на аномално поведение, валидиране на политиките за достъп и наличие на пълни доказателства в случай на инциденти. Инструменти като списъци с разрешени действия, човешки прегледи на критични цикли, саниране на чувствителни данни и контрол върху местоположението на изчисленията (локални, публичен облак, суверенен облак) са съществени елементи на надежден контролен списък. ефективно управление на ИИ.

В този сценарий е жизненоважно да се намери баланс между иновации и контролОрганизациите искат да използват пълноценно потенциала на агентния изкуствен интелект, за да повишат производителността и конкурентоспособността си, но без да жертват сигурността, съответствието с регулаторните изисквания или прозрачността при автоматизираното вземане на решения.

Данни, инфраструктура и изкуствен интелект като фундаментален слой на бизнеса

Погледнато в голямата картина, изкуственият интелект се развива от допълнителен инструмент към... структурен слой, върху който се основава икономическата конкурентоспособностВсичко се върти около тази трансформация: стратегии за данни, облачна архитектура, дизайн на хардуер, модели на работна сила и дори национални политики за дигитална инфраструктура.

От една страна, Данните са консолидирани като основен конкурентен диференциаторТъй като изчисленията и моделирането стават все по-комерсиализирани, това, което прави разликата, е наличието на собствени висококачествени, добре управлявани данни. Наблюдаемостта, чрез улавяне на богата и контекстуална телеметрия, се превръща в един от най-ценните източници на данни за... системи с изкуствен интелект за захранване и да подобрят процесите.

От друга страна, Инфраструктурата с изкуствен интелект започва да се разглежда като стратегически национален активВъзходът на суверенните облаци отговаря на необходимостта от контрол къде се съхраняват и обработват чувствителни данни, как се обучават моделите и при какви регулаторни рамки работят. Държавите инвестират в центрове за данни, оптимизирани за натоварвания, свързани с изкуствен интелект, енергийно ефективни и съобразени с изискванията за съответствие.

Всичко това съвпада с едно ускорена модернизация на центрове за данниПод натиска на енергийните и охладителните изисквания на работните натоварвания с изкуствен интелект и агентските системи, енергийната ефективност вече не е просто оперативен проблем, а се е превърнала в ограничаващ фактор за иновациите и изискване за съответствие с екологичните норми.

Успоредно с това, компаниите са принудени да преквалифицира работната си силаЦелта не е да се превърнат всички в програмисти, а да се обучават професионалисти, способни да организират и използват тези автономни системи: бизнес експерти, задвижвани от изкуствен интелект, инженери, които могат да превърнат оперативните нужди в политики за наблюдаемост и сигурност, и хибридни роли, които разбират както техническото, така и икономическото въздействие на решенията.

Взета заедно, тази еволюция води до сценарий, в който по-отворена и автономна наблюдаемост То се превръща в спойката, която свързва технологиите, бизнеса и регулациите: стандарти като OpenTelemetry гарантират преносимост и качество на данните, изкуственият интелект и наблюдаемостта на агентите намаляват оперативната сложност и ускоряват реакцията при инциденти, а практиките за управление и нулево доверие гарантират, че всичко това се случва под контрол, сигурно и с реална възможност за одит.

Организациите, които успеят да артикулират тази комбинация – стандартизирана телеметрия, унифицирани платформи, фокус върху бизнес резултатите и AI агенти, управлявани с добра наблюдаемост – ще бъдат в най-добра позиция да се конкурират в среда, където цифровите системи са все по-критични, сложни и автономни, но също така и по-способни да генерират осезаема стойност, когато се управляват с правилната видимост.

архитектура на фабрика за изкуствен интелект
Свързана статия:
Архитектура на фабрика за изкуствен интелект: ключове за доброто ѝ изграждане

Добавяне като предпочитан източник