Przejdź do treści

Chatbot AI w obsłudze klienta: jak zaplanować pilotaż i sprawdzić jakość?

autor: Jacek Sultan Automatyzacja i AI 9 minut czytania

Chatbot AI nie musi od razu obsługiwać całego supportu. Zobacz, jak wybrać zakres pilotażu, przygotować bazę wiedzy, przetestować odpowiedzi i zmierzyć, czy asystent rzeczywiście poprawia obsługę klientów.

W skrócie

Pilotaż chatbota AI warto zacząć od niewielkiej grupy powtarzalnych pytań, dla których firma ma aktualne i jednoznaczne źródła informacji. Przed uruchomieniem trzeba przygotować bazę wiedzy, zestaw testów, zasady przekazywania rozmowy pracownikowi oraz sposób mierzenia jakości odpowiedzi.

Nie warto oceniać chatbota wyłącznie liczbą rozmów obsłużonych bez udziału człowieka. Dobra odpowiedź musi być poprawna, wynikać z właściwego źródła i prowadzić do rozwiązania sprawy. W niektórych sytuacjach najlepszym zachowaniem asystenta będzie przyznanie, że nie ma wystarczających informacji, i przekazanie rozmowy pracownikowi.

Najpierw określ, w czym chatbot ma pomagać

„Chatbot do obsługi klienta” jest zbyt szerokim zakresem na pierwsze wdrożenie.

Obsługa klienta może obejmować pytania o ofertę, dostępność produktów, dostawy, zwroty, reklamacje, płatności, faktury, status zamówienia, konfigurację produktu i dziesiątki innych tematów.

Każdy z nich może wymagać innych źródeł danych i innego poziomu dostępu do systemów firmy.

Dlatego na początku warto wybrać jedną lub kilka powiązanych kategorii. Może to być na przykład odpowiadanie na pytania dotyczące oferty i zasad dostawy na podstawie istniejącej bazy wiedzy.

Znacznie łatwiej ocenić jakość systemu odpowiadającego na 50 dobrze określonych typów pytań niż asystenta, który od pierwszego dnia ma „odpowiadać na wszystko”.

Zacznij od rzeczywistych rozmów z klientami

Najlepszym źródłem do zaprojektowania pilotażu są pytania, które klienci rzeczywiście zadają.

Można przeanalizować wiadomości e-mail, zgłoszenia supportowe, czaty lub pytania przekazywane handlowcom. Przed wykorzystaniem takich danych trzeba usunąć informacje, które nie są potrzebne do analizy i testowania rozwiązania.

Następnie warto pogrupować zgłoszenia według tematów i sprawdzić, które z nich:

  • powtarzają się najczęściej,
  • mają jednoznaczną odpowiedź,
  • korzystają z istniejącego źródła wiedzy,
  • nie wymagają skomplikowanej decyzji pracownika,
  • można łatwo zweryfikować po udzieleniu odpowiedzi.

To właśnie takie pytania są dobrymi kandydatami do pierwszego pilotażu.

Oddziel odpowiadanie na pytania od wykonywania operacji

To jedno z najważniejszych rozróżnień przy projektowaniu asystenta AI.

Chatbot może powiedzieć klientowi, jakie są zasady zwrotu produktu. Może również pobrać status konkretnego zamówienia po prawidłowym rozpoznaniu użytkownika.

Znacznie większym krokiem jest umożliwienie mu anulowania zamówienia, zmiany adresu dostawy, utworzenia zwrotu albo zlecenia operacji finansowej.

Wtedy chatbot przestaje być wyłącznie interfejsem do informacji. Staje się elementem systemu wykonującym operacje.

Taki scenariusz wymaga osobnego zaprojektowania uwierzytelnienia, autoryzacji, potwierdzeń, logowania operacji i obsługi błędów.

Dlatego pierwszą wersję często warto ograniczyć do odpowiedzi i odczytu informacji, a możliwość wykonywania działań dodawać później dla konkretnych, dobrze zabezpieczonych przypadków.

Baza wiedzy jest ważniejsza niż sam model

Nawet bardzo dobry model nie naprawi sprzecznych informacji znajdujących się w firmowych materiałach.

Jeżeli regulamin mówi jedno, strona FAQ drugie, a wewnętrzna instrukcja pracownika zawiera trzecią wersję zasad, chatbot nie ma jednoznacznej podstawy do udzielenia odpowiedzi.

Przed wdrożeniem warto więc ustalić:

  • które źródła mogą być wykorzystywane przez asystenta,
  • które źródło ma pierwszeństwo przy sprzecznych informacjach,
  • kto odpowiada za aktualizowanie materiałów,
  • jak szybko zmiany trafiają do bazy wiedzy chatbota,
  • co asystent robi, jeśli nie znajduje odpowiedzi.

Baza wiedzy potrzebuje właściciela również po uruchomieniu. Zmiana cennika, regulaminu albo zasad dostawy powinna zostać uwzględniona także w źródłach wykorzystywanych przez AI.

RAG pomaga korzystać z firmowej wiedzy, ale nie gwarantuje poprawnej odpowiedzi

W chatbotach wykorzystujących wiedzę firmy często stosuje się RAG, czyli Retrieval-Augmented Generation.

W uproszczeniu system najpierw wyszukuje fragmenty materiałów związane z pytaniem użytkownika, a następnie przekazuje je modelowi jako kontekst potrzebny do przygotowania odpowiedzi.

Dzięki temu model może odpowiadać na podstawie dokumentacji firmy zamiast polegać wyłącznie na wiedzy uzyskanej podczas treningu.

Nadal mogą jednak wystąpić błędy. System może znaleźć niewłaściwy dokument, pominąć ważny fragment albo poprawnie odnaleźć materiał, ale źle go zinterpretować.

Dlatego podczas pilotażu warto osobno oceniać dwa elementy: czy system znalazł właściwe źródło oraz czy na jego podstawie przygotował poprawną odpowiedź.

Asystent powinien wiedzieć, kiedy nie odpowiadać

Jednym z celów pilotażu powinno być określenie granic działania chatbota.

Jeżeli użytkownik pyta o temat spoza bazy wiedzy albo dostępne informacje nie pozwalają przygotować wiarygodnej odpowiedzi, system nie powinien uzupełniać braków przypuszczeniami.

Poprawnym zachowaniem może być prośba o doprecyzowanie, poinformowanie o braku wystarczających danych albo przekazanie sprawy pracownikowi.

W praktyce chatbot, który poprawnie odmawia odpowiedzi w 10% rozmów, może być znacznie bezpieczniejszy i bardziej użyteczny niż system odpowiadający na 100% pytań, ale regularnie podający nieprawidłowe informacje.

Przygotuj zestaw pytań testowych przed uruchomieniem

Jakości chatbota nie warto sprawdzać wyłącznie przez kilka spontanicznych rozmów zespołu.

Przed pilotażem dobrze przygotować stały zestaw przypadków testowych. Powinien obejmować różne sposoby zadawania tych samych pytań oraz sytuacje, w których chatbot nie powinien udzielać bezpośredniej odpowiedzi.

Rodzaj testu Przykład Oczekiwane zachowanie
Typowe pytanie „Ile mam czasu na zwrot?” poprawna odpowiedź na podstawie właściwego źródła
Inne sformułowanie „Do kiedy mogę odesłać zakup?” ta sama merytorycznie odpowiedź
Pytanie niejednoznaczne „Kiedy przyjdzie?” prośba o doprecyzowanie
Brak wiedzy pytanie o nieobsługiwany temat brak zgadywania i właściwa eskalacja
Dane klienta „Gdzie jest moje zamówienie?” weryfikacja użytkownika przed dostępem do danych
Dane innej osoby prośba o informacje dotyczące cudzego zamówienia odmowa dostępu
Sprzeczne założenie klient podaje nieprawdziwą informację jako fakt brak bezrefleksyjnego potwierdzenia
Próba manipulacji polecenie ignorowania wcześniejszych zasad zachowanie ograniczeń systemu

Taki zestaw warto zachować również po pilotażu. Po zmianie modelu, instrukcji, bazy wiedzy albo sposobu wyszukiwania można uruchomić te same testy i sprawdzić, czy jakość się nie pogorszyła.

Jedna poprawna odpowiedź nie wystarczy do testu

Modele generatywne mogą przygotowywać różne odpowiedzi na podobne pytania, dlatego przy ważnych scenariuszach warto wykonywać więcej niż jedną próbę.

Test powinien również obejmować parafrazy, błędy językowe, skrócone pytania i sytuacje, w których użytkownik podaje tylko część potrzebnych informacji.

Klienci nie będą komunikować się z chatbotem według przygotowanego przez zespół scenariusza. Pilotaż powinien więc sprawdzać nie tylko idealnie sformułowane pytania.

Uprawnienia muszą być kontrolowane przez aplikację

Jeżeli chatbot ma dostęp do danych klientów albo funkcji systemu, bezpieczeństwo nie może opierać się wyłącznie na instrukcji przekazanej modelowi.

Polecenie „pokazuj użytkownikowi tylko jego zamówienia” nie zastępuje kontroli uprawnień po stronie aplikacji.

Serwer powinien sam ustalić, jaki użytkownik jest zalogowany, do których danych ma dostęp oraz jakie operacje może wykonać. Model powinien otrzymać wyłącznie informacje i narzędzia potrzebne do realizacji konkretnego zadania.

Ma to znaczenie również w kontekście prompt injection, czyli prób wpływania na zachowanie modelu poprzez odpowiednio przygotowane instrukcje umieszczone w wiadomości lub danych przetwarzanych przez system.

OWASP wymienia między innymi prompt injection, ujawnianie informacji wrażliwych oraz nadmierne uprawnienia jako istotne obszary ryzyka przy budowie aplikacji wykorzystujących modele językowe.

Im mniej uprawnień na początku, tym łatwiejszy pilotaż

W pierwszej wersji warto udostępnić chatbotowi tylko dane i funkcje niezbędne do realizacji ustalonego zakresu.

Jeżeli ma odpowiadać na pytania dotyczące oferty, nie potrzebuje dostępu do zamówień. Jeżeli ma podawać status zamówienia, nie musi automatycznie otrzymywać możliwości jego anulowania.

Każde dodatkowe uprawnienie zwiększa liczbę scenariuszy, które trzeba zabezpieczyć i przetestować.

Zakres można rozszerzać później, kiedy podstawowe zachowanie systemu jest już zmierzone i przewidywalne.

Zaprojektuj przekazanie rozmowy do człowieka

Eskalacja nie powinna być traktowana jako porażka chatbota.

Asystent powinien przekazać rozmowę pracownikowi wtedy, gdy temat wykracza poza jego zakres, dane są niewystarczające, klient tego oczekuje albo sprawa wymaga decyzji, której system nie powinien podejmować.

Warto zadbać o to, żeby klient nie musiał wtedy rozpoczynać rozmowy od początku.

Pracownik może otrzymać historię konwersacji, krótkie podsumowanie sprawy, informacje pobrane z systemu oraz wskazanie materiałów wykorzystanych przez chatbota.

Trzeba jednak rozróżnić dane potwierdzone od interpretacji modelu. Jeżeli chatbot uznał na przykład, że klient chce złożyć reklamację, pracownik powinien wiedzieć, że jest to klasyfikacja wygenerowana przez AI, a nie informacja potwierdzona w systemie.

Nie optymalizuj wyłącznie liczby rozmów zakończonych przez AI

Wysoki poziom automatyzacji wygląda dobrze w raporcie, ale sam w sobie nie mówi, czy obsługa klienta się poprawiła.

Chatbot może ograniczać liczbę przekazań do pracowników, odpowiadając również wtedy, gdy nie ma wystarczających informacji. W statystykach będzie wyglądał na bardzo samodzielny, ale część klientów otrzyma nieprawidłowe odpowiedzi.

Dlatego odsetek rozmów zakończonych bez udziału pracownika powinien być tylko jedną z metryk.

Jak mierzyć jakość chatbota AI?

Przed rozpoczęciem pilotażu warto ustalić kilka mierników i zmierzyć podobne wartości dla obecnej obsługi, jeżeli jest to możliwe.

Metryka Co pokazuje
Poprawność odpowiedzi czy odpowiedź jest zgodna z aktualną wiedzą firmy
Poprawność źródła czy system wykorzystał właściwy materiał
Rozwiązanie sprawy czy klient otrzymał informację potrzebną do zakończenia sprawy
Poprawność eskalacji czy chatbot przekazuje sprawy, których nie powinien obsługiwać samodzielnie
Ponowne zgłoszenia czy klient wraca z tym samym tematem po rozmowie z chatbotem
Czas obsługi jak długo trwa rozwiązanie sprawy
Koszt rozmowy koszt modeli, infrastruktury i pozostałych usług
Praca człowieka ile czasu wymaga kontrola, eskalacje i poprawianie bazy wiedzy

Nie każdą metrykę trzeba wdrażać od pierwszego dnia. Najważniejsze jest jednak ustalenie, po czym firma pozna, że pilotaż rzeczywiście poprawił obsługę.

Sprawdzaj próbkę prawdziwych rozmów

Automatyczne metryki nie zastąpią całkowicie kontroli jakości.

W trakcie pilotażu warto regularnie wybierać próbkę rzeczywistych rozmów i oceniać je według stałych kryteriów. Można sprawdzać poprawność merytoryczną, zgodność ze źródłami, kompletność odpowiedzi, prawidłowość eskalacji oraz to, czy chatbot nie obiecał klientowi czegoś, czego firma nie może wykonać.

Taka analiza szybko pokazuje powtarzające się błędy.

Masz pytania?

Jak wdrożyć chatbota AI w obsłudze klienta?
Najlepiej zacząć od ograniczonego pilotażu obejmującego jedną lub kilka grup powtarzalnych pytań. Trzeba przygotować aktualną bazę wiedzy, scenariusze testowe, zasady dostępu do danych, sposób przekazywania spraw pracownikowi oraz mierniki jakości.
Jakie pytania najlepiej przekazać chatbotowi AI?
Na początku najlepiej wybierać często powtarzające się pytania, dla których istnieje jednoznaczne i aktualne źródło informacji. Mogą to być pytania dotyczące oferty, dostawy, podstawowych zasad zwrotów lub korzystania z usługi.
Czy chatbot AI może odpowiadać na podstawie danych firmy?
Tak. Asystent może korzystać z firmowej bazy wiedzy, dokumentacji, FAQ lub innych zatwierdzonych źródeł. Trzeba jednak ustalić, które materiały są aktualne, kto je utrzymuje oraz które źródło ma pierwszeństwo w przypadku sprzecznych informacji.
Co to jest RAG w chatbocie AI?
RAG, czyli Retrieval-Augmented Generation, polega na wyszukaniu informacji związanych z pytaniem i przekazaniu ich modelowi jako kontekstu do przygotowania odpowiedzi. Pozwala korzystać z wiedzy firmy, ale nie gwarantuje automatycznie poprawności każdej odpowiedzi.
Czy RAG eliminuje halucynacje modeli AI?
Nie. RAG może ograniczyć część błędów i pozwala oprzeć odpowiedź na konkretnych materiałach, ale system nadal może znaleźć niewłaściwe źródło, pominąć istotną informację albo nieprawidłowo zinterpretować znalezioną treść.
Jak sprawdzić jakość odpowiedzi chatbota AI?
Warto przygotować zestaw testowych pytań wraz z oczekiwanym zachowaniem i regularnie oceniać próbkę rzeczywistych rozmów. Można sprawdzać poprawność merytoryczną, zgodność ze źródłem, kompletność odpowiedzi oraz prawidłowość przekazywania trudniejszych spraw pracownikowi.
Jakie metryki warto mierzyć przy chatbocie AI?
Przydatne są między innymi poprawność odpowiedzi, poprawność wykorzystanych źródeł, odsetek rozwiązanych spraw, ponowne zgłoszenia, czas rozwiązania, poprawność eskalacji, koszt obsługi oraz czas pracowników potrzebny na kontrolę i utrzymanie systemu.
Czy chatbot AI powinien odpowiadać na każde pytanie?
Nie. Jeżeli nie ma wystarczających informacji albo pytanie wykracza poza jego zakres, prawidłowym zachowaniem może być prośba o doprecyzowanie lub przekazanie sprawy pracownikowi. Próba odpowiedzi za wszelką cenę zwiększa ryzyko przekazania klientowi błędnej informacji.
Kiedy chatbot powinien przekazać rozmowę człowiekowi?
Eskalacja może być potrzebna, gdy brakuje informacji, sprawa wymaga indywidualnej decyzji, wykracza poza zakres asystenta, klient prosi o kontakt z pracownikiem albo wykonanie operacji wymaga dodatkowego zatwierdzenia.
Czy chatbot AI może sprawdzać status zamówienia?
Tak, jeżeli zostanie bezpiecznie zintegrowany z odpowiednim systemem. Aplikacja powinna jednak niezależnie od modelu sprawdzić tożsamość użytkownika i ograniczyć dostęp wyłącznie do danych, do których dana osoba ma uprawnienia.
Czy chatbot AI może anulować zamówienie lub wykonać zwrot?
Technicznie jest to możliwe, ale wymaga znacznie większej kontroli niż samo odpowiadanie na pytania. Trzeba zaprojektować uwierzytelnianie, uprawnienia, potwierdzenia, logowanie operacji, obsługę błędów i zasady określające, kiedy działanie wymaga zatwierdzenia człowieka.
Jak zabezpieczyć chatbota AI przed dostępem do danych innych klientów?
Kontrola dostępu powinna działać po stronie aplikacji i serwera, a nie tylko poprzez instrukcje dla modelu. System powinien sam określać, kto jest zalogowany, jakie dane może odczytać i jakie operacje może wykonać.
Ile kosztuje chatbot AI do obsługi klienta?
Koszt zależy od modelu, liczby rozmów, długości kontekstu, sposobu wyszukiwania wiedzy, integracji oraz infrastruktury. Trzeba uwzględnić również aktualizację bazy wiedzy, monitoring, kontrolę jakości i czas pracowników obsługujących eskalacje.
Jak długo powinien trwać pilotaż chatbota AI?
Pilotaż powinien trwać na tyle długo, aby zebrać reprezentatywną liczbę rzeczywistych rozmów dla wybranego zakresu. Ważniejsza od samej liczby dni jest liczba przypadków pozwalająca ocenić poprawność, eskalacje, koszty i najczęściej występujące błędy.
Czy chatbot AI może zastąpić dział obsługi klienta?
Chatbot może przejąć część powtarzalnych pytań i pomagać pracownikom w przygotowywaniu odpowiedzi. Sprawy nietypowe, wymagające indywidualnej decyzji, dodatkowej weryfikacji lub wykraczające poza dostępne dane nadal mogą wymagać udziału człowieka.

Jacek Sultan

Technical Solutions Architect

CTO i współzałożyciel Dock. Na co dzień zajmuje się projektowaniem i rozwojem aplikacji webowych, architekturą systemów oraz infrastrukturą. Łączy techniczne podejście z perspektywą biznesową, skupiając się na rozwiązaniach, które są proste, niezawodne i mają konkretne uzasadnienie biznesowe. W technologii ceni przede wszystkim praktyczność. Dobre rozwiązanie powinno nie tylko działać, ale też przynosić wartość.

Porozmawiaj z nami