Commit f2c54d14 authored by jg5dev's avatar jg5dev 💬
Browse files

better

parent d2c62977
Loading
Loading
Loading
Loading
+1 −1
Original line number Diff line number Diff line
@@ -65,7 +65,7 @@
    - [Aprenentatge continu](./apren/ba2/04_continual_learning.md)  
    - [Patrons d'implementació](./apren/ba2/05_implementation_patterns.md)
  - [LLMs i IA Generativa](./apren/llms.md)
    - [Transformers i LLMs](./apren/llms/ml_transformers.md)
    - [Transformers i Models de Llenguatge](./apren/llms/ml_transformers.md)
    - [LLM vs. ML tradicional](./apren/llms/llm_vs_ml.md)
    - [Arquitectura de sistemes LLM](./apren/llms/llm_architecture.md)
    - [Prompts i integració](./apren/llms/llm_systems.md)
+25 −11
Original line number Diff line number Diff line
# LLMs i IA Generativa

Models de llenguatge grans: arquitectura, ús aplicat i desplegament de sistemes basats en LLMs.

- [Transformers i LLMs](./llms/ml_transformers.md)
- [LLM vs. ML tradicional](./llms/llm_vs_ml.md)
- [Arquitectura de sistemes LLM](./llms/llm_architecture.md)
- [Prompts i integració](./llms/llm_systems.md)
- [Orquestració amb workflows i agents](./llms/llm_patterns.md)
- [Avaluació de sistemes LLM](./llms/llm_evals.md)
- [Arquitectures per cas d'ús](./llms/llm_use_cases.md)
- [Selecció de model per cas d'ús](./llms/llm_model_selection.md)
- [Sistemes LLM en producció](./llms/llm_production.md)
Models de llenguatge grans: arquitectura, ús aplicat i desplegament de sistemes basats en LLMs. Els documents segueixen una progressió: primer els fonaments, després la construcció de sistemes i, finalment, l'avaluació, l'aplicació a casos concrets i l'operació en producció.

## Fonaments

- [Transformers i Models de Llenguatge](./llms/ml_transformers.md): de les RNN a l'atenció i el transformer, i com el preentrenament, l'alineament i l'escalat donen lloc als LLMs actuals
- [LLM vs. ML tradicional](./llms/llm_vs_ml.md): marc de decisió per triar entre LLM, ML clàssic o una opció intermèdia segons les dades, el cost i l'estabilitat de la tasca

## Construcció de sistemes

- [Arquitectura de sistemes LLM](./llms/llm_architecture.md): el LLM com a component de programari, el servei d'inferència (Ollama, vLLM), l'API estàndard i els requisits de maquinari
- [Prompts i integració](./llms/llm_systems.md): dissenyar prompts com a artefactes de programari i cridar el model des del codi, amb sortida estructurada, memòria, resiliència i seguretat
- [Orquestració amb workflows i agents](./llms/llm_patterns.md): compondre les crides en sistemes: workflows deterministes, RAG, agents amb eines, MCP i sistemes multi-agent

## Avaluació

- [Avaluació de sistemes LLM](./llms/llm_evals.md): golden set, anàlisi d'errors, LLM-as-judge i el cicle de millora dirigit per evals

## Aplicació

- [Arquitectures per cas d'ús](./llms/llm_use_cases.md): nou casos d'ús concrets, amb les capes actives, les decisions de disseny i un exemple de codi per a cadascun
- [Selecció de model per cas d'ús](./llms/llm_model_selection.md): matriu de capacitats i criteris per triar model (API comercial o local) per a cada cas

## Operació

- [Sistemes LLM en producció](./llms/llm_production.md): observabilitat, control de costos, desplegament i cicle de vida del sistema
+2 −2
Original line number Diff line number Diff line
@@ -150,8 +150,8 @@ El raonament extès (thinking tokens) millora la qualitat en tasques on el nombr

Tres mecanismes redueixen el cost sense canviar de model:

1. **Prompt caching**: per a system prompts llargs i estàtics (> 1K tokens) amb moltes peticions, el caching pot reduir el cost d'entrada en un 80–90%. Imprescindible per als casos 4 i 6.
2. **Batch API**: els proveïdors comercials processen batches asíncronament amb un 50% de descompte. Adequat quan no hi ha restriccions de temps (cas 6).
1. **Prompt caching**: per a system prompts llargs i estàtics (> 1K tokens) amb moltes peticions, el caching redueix substancialment el cost d'entrada (vegeu [Control de costos](llm_production.md#control-de-costos)). Imprescindible per als casos 4 i 6.
2. **Batch API**: els proveïdors comercials processen batches asíncronament a cost per token reduït. Adequat quan no hi ha restriccions de temps (vegeu el cas 6 d'[Arquitectures per cas d'ús](llm_use_cases.md#6-pipeline-de-processament-en-batch)).
3. **Model mínim suficient**: mesurar la qualitat per tasca senzilla amb el model petit abans d'assumir que cal el gran. En classificació i extracció, models petits sovint arriben al 95% de la qualitat del model gran.

### Per cas d'ús: punts de partida
+2 −2
Original line number Diff line number Diff line
@@ -2,7 +2,7 @@

<!-- toc -->

Aquest document cobreix els dos patrons fonamentals per construir sistemes amb LLMs: **workflows**, on l'orquestrador controla el flux i el model omple tasques concretes; i **agents**, on el model decideix dinàmicament quines accions executar. Per a la capa anterior, com es dissenyen els prompts i com es crida l'API d'un model, consulta [Crides a un LLM: disseny de prompts i integració](llm_systems.md). Per a la infraestructura (servidors, maquinari, models), consulta [Arquitectura de sistemes LLM](llm_architecture.md).
Aquest document cobreix els dos patrons fonamentals per construir sistemes amb LLMs: **workflows**, on l'orquestrador controla el flux i el model omple tasques concretes; i **agents**, on el model decideix dinàmicament quines accions executar. Per a la capa anterior, com es dissenyen els prompts i com es crida l'API d'un model, consulta [Prompts i integració](llm_systems.md). Per a la infraestructura (servidors, maquinari, models), consulta [Arquitectura de sistemes LLM](llm_architecture.md).

El document s'estructura en tres blocs:

@@ -124,7 +124,7 @@ Una variant de la paral·lelització és la **votació per majoria** (*ensemble*

### Cascada de models i escalat per confiança

L'encadenament posa crides en seqüència perquè cada pas depèn de l'anterior. La **cascada** és un patró diferent: col·loca diversos mètodes que resolen *la mateixa* tasca en ordre de cost creixent. Cada nivell intenta resoldre el cas, i només si no ho aconsegueix amb prou confiança escala al nivell següent, més car i més capaç. Els nivells barats despatxen la majoria fàcil; el nivell car (típicament un LLM gran) només s'executa sobre el residu difícil. La indústria ho anomena *model cascade* o *confidence-gated escalation*, i és l'aplicació directa del principi "comença pel més simple" que ja apareix a la guia de baseline (regles, després embedding, després LLM) de [Quan usar un LLM](llm_vs_ml.md) i a l'escala de prompting (zero-shot, few-shot, chain-of-thought, fine-tuning) de [Crides a un LLM](llm_systems.md).
L'encadenament posa crides en seqüència perquè cada pas depèn de l'anterior. La **cascada** és un patró diferent: col·loca diversos mètodes que resolen *la mateixa* tasca en ordre de cost creixent. Cada nivell intenta resoldre el cas, i només si no ho aconsegueix amb prou confiança escala al nivell següent, més car i més capaç. Els nivells barats despatxen la majoria fàcil; el nivell car (típicament un LLM gran) només s'executa sobre el residu difícil. La indústria ho anomena *model cascade* o *confidence-gated escalation*, i és l'aplicació directa del principi "comença pel més simple" que ja apareix a la guia de baseline (regles, després embedding, després LLM) de [Quan usar un LLM](llm_vs_ml.md) i a l'escala de prompting (zero-shot, few-shot, chain-of-thought, fine-tuning) de [Prompts i integració](llm_systems.md).

```text
cas d'entrada
+1 −3
Original line number Diff line number Diff line
@@ -230,9 +230,7 @@ Els sistemes LLM s'actualitzen per raons diferents als models ML clàssics (que

### Versionat de prompts

Els prompts no són codi, però han de rebre el mateix tractament que la configuració crítica: versió controlada i desplegament explícit. Un canvi de prompt passa pel cicle d'evals com qualsevol altra modificació del sistema (veure [El cicle de millora dirigit per evals](llm_evals.md#el-cicle-de-millora-dirigit-per-evals)).

Emmagatzemar els prompts en fitxers de text versionats (no hardcodejats al codi) facilita la revisió de canvis i permet associar cada versió del sistema a un conjunt de prompts concret. Evitar la **deriva de prompts** — modificacions informals fetes directament en producció sense passar per les evals — és un dels hàbits d'operació més importants en sistemes LLM.
Els prompts són lògica d'aplicació i es versionen com a tal: fitxers de text sota control de versions, mai strings hardcodejats al codi (vegeu [Prompts com a artefactes de codi](llm_systems.md#prompts-com-a-artefactes-de-codi)). El que hi afegeix l'operació en producció són dos hàbits: cada canvi de prompt passa pel cicle d'evals com qualsevol altra modificació del sistema (veure [El cicle de millora dirigit per evals](llm_evals.md#el-cicle-de-millora-dirigit-per-evals)), i cada versió desplegada queda associada a un conjunt de prompts concret. Evitar la **deriva de prompts** (modificacions informals fetes directament en producció sense passar per les evals) és un dels hàbits d'operació més importants en sistemes LLM.

### Avaluació

Loading