Sapio — data-driven AI
ENRO
C2

Cum construiesc un chatbot care știe datele firmei mele (RAG)

De Vlad TudorUltima actualizare: iunie 2026Read in English

Un chatbot RAG (retrieval-augmented generation) răspunde din documentele firmei tale, nu din memoria generală a modelului: caută întâi fragmentele relevante, apoi formulează răspunsul cu surse. Îl construiești pregătind documentele, împărțindu-le în fragmente, generând embeddings într-un vector database, apoi căutând și generând răspunsul.

  • RAG (retrieval-augmented generation) înseamnă că modelul caută întâi în documentele tale și abia apoi formulează răspunsul, cu surse.
  • Pașii: pregătești documentele, le împarți în fragmente, le transformi în embeddings, le stochezi într-un vector database, apoi cauți și generezi răspunsul.
  • Pentru date care se schimbă des, RAG bate fine-tuning-ul: actualizezi corpusul fără să reantrenezi modelul.
  • În română contează diacriticele, formele flexionare și jargonul de domeniu — sunt cauze reale de răspunsuri greșite dacă nu le tratezi.

Ce este, mai exact, un chatbot RAG?

Un chatbot RAG este un asistent care nu răspunde din ce „știe” modelul în general, ci din documentele tale. RAG vine de la retrieval-augmented generation: înainte să genereze un răspuns, sistemul caută („retrieval”) fragmentele relevante din baza ta de cunoștințe și le dă modelului ca context, iar modelul formulează răspunsul pe baza lor („generation”). Diferența practică este uriașă. Un chatbot generic îți va inventa cu încredere un articol de lege sau o clauză de contract care nu există — fenomenul de halucinație. Un chatbot RAG corect construit răspunde doar din ce a găsit și poate cita sursa, iar când nu găsește nimic relevant spune că nu știe, în loc să improvizeze. La Sapio construim astfel de sisteme, iar exemplul nostru cel mai clar este ai-aflat.ro, asistentul AI pentru legislația din România, unde am indexat peste 200.000 de texte legislative. La scara aceea, diferența dintre „caută apoi răspunde” și „răspunde din memorie” nu este o nuanță, este diferența dintre un instrument folosibil și unul periculos.

Care sunt pașii ca să construiești un chatbot pe datele firmei?

Un sistem RAG are o coloană vertebrală clară. Pașii de mai jos sunt aceiași fie că ai 500 de documente, fie că ai 50.000, dar fiecare devine mai greu pe măsură ce corpusul crește — aici se vede dacă echipa a mai construit la scară.

  1. Pregătești sursele: aduni documentele, le cureți, scoți duplicatele și extragi textul din PDF-uri și scanuri (aici intră OCR-ul pentru documentele needitabile).
  2. Împarți textul în fragmente (chunking): bucăți suficient de mici cât să fie precise, dar suficient de mari cât să-și păstreze sensul. Chunking-ul prost este cea mai frecventă cauză de răspunsuri proaste.
  3. Generezi embeddings: transformi fiecare fragment într-un vector numeric care îi codifică sensul, ca să poată fi căutat după înțeles, nu doar după cuvinte-cheie.
  4. Stochezi vectorii într-un vector database, peste care rulează căutarea semantică la fiecare întrebare.
  5. La fiecare întrebare cauți fragmentele relevante, le dai modelului ca context și ceri un răspuns care citează sursele.
  6. Evaluezi și reglezi: testezi pe întrebări reale, măsori câte răspunsuri sunt corecte și ajustezi chunking-ul, căutarea și prompturile până ești mulțumit.

RAG sau fine-tuning — pe care îl alegi?

Sunt două moduri diferite de a face un model să lucreze cu cunoștințele tale, iar oamenii le confundă des. RAG adaugă cunoștințele la momentul întrebării, din afara modelului. Fine-tuning-ul rescrie comportamentul modelului prin reantrenare pe exemple. În majoritatea proiectelor de tip „chatbot pe documentele firmei”, RAG este alegerea corectă, pentru că datele tale se schimbă și vrei surse citabile. Fine-tuning-ul își are locul când ai nevoie de un ton sau un format fix, nu de cunoștințe noi.

CriteriuRAGFine-tuning
Ce rezolvăAduce cunoștințe din documentele taleSchimbă tonul, formatul, stilul răspunsului
Date care se schimbă desIdeal — actualizezi corpusul, nu modelulSlab — fiecare schimbare cere reantrenare
Surse citabile în răspunsDa, din construcțieNu
Cost și timp până în producțieMai mic, săptămâniMai mare, plus efort de date de antrenare
Când îl alegiAsistent pe documente, FAQ intern, suportTon/format fix pe un domeniu îngust

În practică, cele două nu se exclud: poți folosi RAG pentru cunoștințe și fine-tuning pentru ton, în același sistem. Dar dacă pleci la drum cu un singur pariu, pentru un chatbot care știe datele firmei, RAG este punctul de start aproape întotdeauna.

Ce este special la un chatbot RAG în limba română?

Multe sisteme RAG funcționează bine în engleză și se poticnesc în română, iar problema apare exact la pasul de căutare. Diacriticele sunt prima capcană: dacă utilizatorul scrie fără ele, iar documentele le au (sau invers), căutarea ratează fragmente relevante. A doua este flexiunea bogată a românei — un cuvânt are multe forme (contract, contractului, contractelor), iar o căutare naivă le tratează ca termeni diferiți. A treia este jargonul de domeniu: limbajul juridic, medical sau tehnic românesc are termeni pe care un model antrenat majoritar pe engleză nu îi reprezintă bine. Din experiența noastră pe ai-aflat.ro, unde corpusul este în întregime în română juridică, aceste trei lucruri fac diferența între un asistent care găsește textul corect și unul care răspunde alături. Le tratăm prin normalizarea diacriticelor, embeddings care înțeleg româna și o etapă de testare pe întrebări reale, formulate așa cum le scriu oamenii. Vezi cum arată la scară în studiul de caz ai-aflat.ro.

Cum pornesc un chatbot RAG pentru firma mea?

Începe cu un corpus mic și o întrebare clară: ce vrei să răspundă asistentul și pentru cine. Un pilot pe câteva sute de documente bine alese îți arată mai mult decât un proiect mare construit pe presupuneri. Apoi măsoară acuratețea pe întrebări reale înainte să-l dai utilizatorilor. Dacă vrei să vezi cum am face noi acest lucru pe datele tale, citește despre serviciile noastre de AI, unde un asistent pe documente devine parte dintr-un flux, apoi programează o discuție inițială gratuită cu echipa Sapio. În acea discuție stabilim ce documente intră în corpus, ce întrebări trebuie să acopere și dacă un pilot are sens înainte de un sistem complet.

Pe ai-aflat.ro, asistentul AI pentru legislația din România, am indexat peste 200.000 de texte legislative — proba directă a Sapio pentru RAG pe un corpus mare în limba română.

Întrebări frecvente

Ce înseamnă RAG la un chatbot?

RAG vine de la retrieval-augmented generation. Înainte să răspundă, chatbotul caută în documentele tale fragmentele relevante și le dă modelului ca context, iar modelul formulează răspunsul pe baza lor. Așa răspunde din datele tale, poate cita sursa și evită să inventeze informații care nu există în corpus.

RAG sau fine-tuning pentru un chatbot pe datele firmei?

Pentru cunoștințe care se schimbă și răspunsuri cu surse, RAG este alegerea corectă: actualizezi corpusul fără să reantrenezi modelul. Fine-tuning-ul rezolvă tonul și formatul fix, nu cunoștințe noi, și costă mai mult. Cele două se pot combina în același sistem, dar RAG este de obicei punctul de start.

Funcționează RAG bine în limba română?

Funcționează, dacă tratezi trei lucruri: diacriticele, formele flexionare bogate ale românei și jargonul de domeniu. Ignorate, ele fac ca pasul de căutare să rateze fragmente relevante. Le rezolvăm prin normalizarea diacriticelor, embeddings care înțeleg româna și testare pe întrebări reale — din experiența pe ai-aflat.ro, corpus integral în română juridică.

Câte documente îmi trebuie ca să pornesc un chatbot RAG?

Mai puține decât crezi pentru un pilot. Câteva sute de documente bine alese, pe o întrebare clară, îți arată dacă sistemul răspunde corect înainte de o investiție mare. Pe ai-aflat.ro rulăm peste 200.000 de texte, deci scara mare e fezabilă, dar nu e necesară ca să validezi ideea.

Chatbotul RAG poate inventa răspunsuri?

Un sistem RAG corect construit reduce mult acest risc, pentru că răspunde doar din fragmentele găsite și poate cita sursa. Când nu găsește nimic relevant, ar trebui să spună că nu știe, nu să improvizeze. Halucinațiile rămân posibile dacă chunking-ul și căutarea sunt prost reglate, de aceea contează etapa de evaluare.

Vrei să discutăm un proiect?

Programează o discuție inițială gratuită cu echipa Sapio.

Cum construiesc un chatbot care știe datele firmei mele (RAG) | Sapio AI