@@ -294,6 +294,8 @@ Les tres mètriques del marc **RAGAS** cobreixen aquest espai:
| **Faithfulness** | La resposta es basa únicament en els fragments recuperats? | LLM-as-judge: cada afirmació de la resposta es pot atribuir als fragments? |
| **Answer relevance** | La resposta respon realment la pregunta de l'usuari? | LLM genera preguntes a partir de la resposta i comprova si coincideixen amb la original |
Aquestes són les tres mètriques del marc original. La llibreria actual de RAGAS divideix la *context relevance* en dues mètriques més fines, **Context Precision** i **Context Recall**, però la lògica de diagnòstic és la mateixa.
### Per què avaluar les dues etapes per separat
Una resposta final correcta no implica que el sistema funcioni bé: pot ser que el model hagi respost correctament malgrat haver recuperat fragments poc rellevants (perquè la resposta era trivial). Inversament, una resposta incorrecta pot deure's a una recuperació deficient o a una generació infidel, i el remei és diferent en cada cas.
@@ -186,7 +186,7 @@ Abans d'afegir la infraestructura de recuperació, val la pena preguntar-se si e
**Criteri pràctic**: testa els marges, no el centre. El model respondrà bé les preguntes típiques del domini. La qüestió és si les preguntes atípiques — un cas nínxol, un canvi recent, una situació individual complexa — estan dins del rang acceptable per al teu cas d'ús.
**Quan cal RAG**: si les consultes necessiten informació posterior al tall d'entrenament, fonts citables, o un corpus específic de domini (metodologia pròpia, normativa interna, base de coneixement privada). RAG no millora el que el model ja sap — afegeix accés a fonts que no estan als seus pesos. Les dades específiques de l'usuari (historial, registres, mesures) no són un cas de RAG — són dades estructurades que s'obtenen per consulta determinista a una BD i s'injecten al prompt per regla (vegeu *Dades pre-recuperades per regla* a la taula anterior). Els detalls d'indexació, embeddings, chunking, vector databases i avaluació es tracten a [Integració i execució](llm_systems.md#recuperació-embeddings-i-índexs).
**Quan cal RAG**: si les consultes necessiten informació posterior al tall d'entrenament, fonts citables, o un corpus específic de domini (metodologia pròpia, normativa interna, base de coneixement privada). RAG no millora el que el model ja sap — afegeix accés a fonts que no estan als seus pesos. Les dades específiques de l'usuari (historial, registres, mesures) no són un cas de RAG — són dades estructurades que s'obtenen per consulta determinista a una BD i s'injecten al prompt per regla (vegeu *Dades pre-recuperades per regla* a la taula anterior). Els detalls d'indexació, embeddings, chunking i vector databases es tracten a [Integració i execució](llm_systems.md#recuperació-embeddings-i-índexs); l'avaluació del pipeline, a [Evals per a RAG](llm_evals.md#evals-per-a-rag).
**Quan afegir fine-tuning**: útil quan el problema no és d'accés a dades sinó de comportament: classificació, consistència de format, to, seguiment d'instruccions o patrons de sortida repetibles. Si el model ja coneix el domini però falla de manera sistemàtica en com respon, el fine-tuning pot ser més adequat que RAG. Si el problema és falta d'informació específica o recent, RAG continua sent la millor opció.
**Qualitat de recuperació**: la cerca híbrida (vectorial + BM25) millora la precisió quan hi ha termes exactes importants. El reranking amb cross-encoder ajuda a reordenar candidats. Per mesurar el pipeline, RAGAS és un marc habitual: Faithfulness per a la consistència amb el context, Answer Relevancy per a la resposta, i Context Precision/Recall per a la recuperació. Per a preguntes fortament relacionals, GraphRAG pot ser una alternativa, però és molt més car i complex.
**Qualitat de recuperació**: la cerca híbrida (vectorial + BM25) millora la precisió quan hi ha termes exactes importants. El reranking amb cross-encoder ajuda a reordenar candidats. Per mesurar el pipeline, el marc habitual és RAGAS: les seves mètriques i com diagnostiquen cada etapa es tracten a [Evals per a RAG](llm_evals.md#evals-per-a-rag). Per a preguntes fortament relacionals, GraphRAG pot ser una alternativa, però és molt més car i complex.
@@ -259,7 +259,7 @@ Resposta fonamentada + referències a les fonts
**Entrada (consulta):** text pla (pregunta en LN).
**Sortida:** text pla o markdown amb citacions de font integrades. Les referències (fitxer, secció) s'inclouen als resultats de l'eina de cerca i el model les incorpora a la resposta.
**Sortida:** text pla o markdown amb citacions de font integrades. Les referències (fitxer, secció) s'injecten com a marcadors al context recuperat (per exemple `[Font: ...]`) i el model les incorpora a la resposta.