
Baza wiedzy AI to zbiór firmowych dokumentów podzielonych na fragmenty i zapisanych tak, żeby model językowy znalazł te, które odpowiadają na pytanie, i odpowiedział na ich podstawie. Działa dobrze pod trzema warunkami: dokumenty są aktualne, fragmenty mają sensowną wielkość, a próg dopasowania jest zmierzony, nie zgadnięty.
Model językowy nie uczy się Twoich dokumentów. Dostaje je w chwili pytania, w czterech krokach:
Zmiana w dokumencie zmienia więc odpowiedź bez trenowania czegokolwiek. Wystarczy ponownie przeliczyć wektory zmienionych fragmentów.
Chatbot na tej stronie działa dokładnie według tego schematu, więc zamiast przykładu z wyobraźni masz tu jego ustawienia.
gemini-embedding-001 w 768 wymiarach. Model domyślnie zwraca 3072, a dokumentacja Google zaleca 768, 1536 albo 3072. Mniejszy wektor zajmuje mniej miejsca i szybciej się porównuje.Próg 0,6 nie wziął się z poradnika. Pomiar na bazie 321 fragmentów pokazał, że trafne fragmenty dostają od 0,65 do 0,73. Przy często polecanym progu 0,7 odpadała odpowiedź o przebiegu współpracy, która miała 0,679. Klient pytający, jak wygląda współpraca, dostałby wtedy „nie wiem”, choć odpowiedź była w bazie.
Takiego asystenta dla klientów albo zespołu buduję w ramach usługi agenci AI i chatboty.
Dwie wersje tego samego dokumentu. Stary cennik obok nowego to przepis na odpowiedź, która raz podaje jedną kwotę, a raz drugą. Wyszukiwanie nie wie, która wersja obowiązuje. Każda informacja powinna mieć w bazie jedno źródło, a wycofany dokument ma z niej znikać.
Zmiana modelu embeddingów. Wektory z różnych modeli nie są porównywalne. Google wycofał model text-embedding-004, co odnotowuje strona wycofanych modeli Gemini API. Chatbot na tej stronie przeszedł z niego na gemini-embedding-001 w sierpniu 2026, a przejście wymagało przeliczenia całej bazy od zera. Przy wyborze modelu sprawdź, czy dostawca nie zapowiada już jego wycofania.
Dokumenty, których pytający nie powinien widzieć. Baza wiedzy odpowiada tym, co w niej jest. Jeśli asystent dla klientów ma w bazie wewnętrzne procedury albo marże, prędzej czy później je zacytuje. Asystent publiczny powinien mieć bazę złożoną wyłącznie z treści publicznych, a wewnętrzny osobną, z kontrolą dostępu.
Jeśli nie wiesz, od których pytań i dokumentów zacząć, wybór ułatwi audyt i doradztwo AI.
Jeśli baza ma zasilać automatyczne odpowiedzi na maile, zobacz trzeci przepływ w artykule o automatyzacjach n8n z AI. Jak takie odpowiedzi wpiąć w kontakt z klientem, opisuje artykuł o automatyzacji obsługi klienta.
Czy to to samo co trenowanie modelu na firmowych danych? Nie. Model pozostaje bez zmian, a dokumenty dostaje w chwili pytania. Dzięki temu aktualizacja wiedzy to przeliczenie fragmentów, a nie nowe trenowanie.
Czy firmowe dokumenty trafiają do dostawcy modelu? Tak, w części. Fragmenty wysyłane do modelu embeddingów i te dołączane do pytania przechodzą przez API dostawcy. Dokumenty, których nie wolno wysłać na zewnątrz, wymagają modelu uruchomionego na własnym serwerze albo pozostają poza bazą.
Czy baza wiedzy musi mieć formę chatbota? Nie. Ta sama baza może podpowiadać odpowiedzi pracownikowi w skrzynce, odpowiadać na pytania w Slacku albo przygotowywać szkice maili do zatwierdzenia.
Jak sprawdzić, czy baza odpowiada dobrze? Stałym zestawem pytań testowych, uruchamianym po każdej większej zmianie dokumentów. Jeśli trafna odpowiedź przestaje się pojawiać, wiesz o tym przed klientem.
Zanim powstanie pierwszy fragment, trzeba zdecydować, na jakie pytania baza ma odpowiadać i które dokumenty są jedynym źródłem prawdy. Od tej rozmowy zaczyna się każde wdrożenie asystenta opartego na firmowej wiedzy.