LLMs – As Partes Difíceis

Soluções open source de IA para as armadilhas mais comuns

LLMs – As Partes Difíceis
× LLMs – As Partes Difíceis

LLMs – As Partes Difíceis

Compartilhar

Autores: Thársis T. P. Souza
Jonathan K. Regenstein Jr.

ISBN impresso: 978-65-83913-08-1
ISBN ebook: 978-65-83913-09-8
Ano: 2026
Páginas: 344
Preço impresso: R$ 139,00 O ebook deste livro está disponível na Amazon.

Opine sobre este livro

Descrição do livro

“Escrito por dois especialistas renomados, este guia indispensável prepara leitores de todos os níveis de habilidade para navegar LLMs com sucesso.” – Sudheer Chava, professor titular da cátedra Alton M. Costley e diretor, Financial Services Innovation Lab, Georgia Tech

“Este livro aborda, de forma criteriosa e com embasamento prático, os desafios que realmente importam nos sistemas de LLM do mundo real.” – Tomaso Aste, professor titular de ciência da complexidade, Universidade de Londres

Os LLMs (large language models, grandes modelos de linguagem) transformaram o processamento de linguagem natural, mas implantá-los em aplicações introduz inúmeros desafios técnicos. LLMs – As Partes Difíceis oferece uma análise clara e prática das limitações que desenvolvedores e engenheiros de IA enfrentam ao construir aplicações baseadas em LLM. Com foco nas armadilhas de implementação (e não apenas nas capacidades), este livro fornece estratégias práticas, apoiadas por código Python reproduzível e por ferramentas open source.

Os leitores aprenderão a superar os principais obstáculos na avaliação, no gerenciamento de contexto, nos testes e na segurança de aplicações baseadas em LLMs. Projetado para desenvolvedores e líderes técnicos de produtos, este guia enfatiza soluções práticas para problemas do mundo real e promove uma compreensão fundamentada das restrições e compensações (trade-offs) dos LLMs.

• Projete estratégias de teste e avaliação para sistemas não determinísticos

• Gerencie contexto, RAG e recuperação de contextos longos

• Lide com a inconsistência nas saídas e com a falta de confiabilidade estrutural

• Implemente estruturas de segurança e moderação de conteúdo

• Explore os desafios de alinhamento e técnicas de mitigação de riscos

• Use modelos open source localmente

Ver menos ▲

Sumário

  • Apresentação
  • Prefácio
  • CAPÍTULO 1: Princípios básicos: o que considerar antes de construir com LLMs
  • Por que open source?
  • Considerações estratégicas
    • Requisitos empresariais
    • Requisitos relacionados aos stakeholders
    • Requisitos de conformidade e segurança
    • Requisitos de desempenho
    • Requisitos operacionais
    • Requisitos de integração
    • Requisitos de gerenciamento de dados
  • Estruturas organizacionais de IA
    • Estrutura centralizada
    • Estrutura descentralizada
    • Estrutura federada
  • A importância dos dados
  • Tipos de modelo
    • Modelos base
    • Modelos ajustados por instrução
    • Modelos adaptados ao domínio
  • Características dos modelos
    • Tamanho do contexto
    • Controle da saída
    • Caching
    • Limite de tokens de saída
  • Custo e velocidade
  • Licenciamento
  • Personalização
  • Pequenos modelos de linguagem
  • Conclusão
  • CAPÍTULO 2: A lacuna da avaliação
  • A natureza não determinística dos LLMs
    • Fonte do não determinismo
    • Temperatura
    • Testes de temperatura no 10-K de uma LLMBA
  • O desafio das avaliações
  • Projetando um framework de avaliação de LLMBA
    • Design conceitual: uma única LLMBA
    • Design conceitual: várias LLMBAs
  • Metodologias de avaliação
    • Métricas quantitativas
    • Codificando o BLEU e o ROUGE
    • Codificando um LLM como juiz
    • Limitações do LLM como juiz
    • Avaliando os avaliadores
  • Uma breve introdução aos benchmarks de LLM
  • O ARC-AGI e o prêmio
  • Conclusão
  • CAPÍTULO 3: Ferramentas de avaliação para aplicações baseadas em LLMs
  • LangSmith
    • BLEU com o LangSmith
      • Criando um dataset padrão-ouro
      • Calculando pontuações BLEU
      • Gere um resumo
      • Execute a avaliação
    • Ampliando o LLM como juiz com o LangSmith
  • Promptfoo
    • Avaliando modelos com o Promptfoo
    • Avaliando prompts
  • LightEval
    • Configuração do LightEval
    • Avaliação econométrica com o MMLU
    • Comparando múltiplos modelos em econometria
    • Comparação de frameworks
  • Conclusão
  • CAPÍTULO 4: Dos dados ao contexto
  • Pré-processando documentos
    • PyPDF2
    • MarkItDown
    • Docling
  • RAG
    • Processo do RAG
    • Chunking de documentos
    • Estratégias de chunking
    • Estudo de caso de chunking
      • Gerando conteúdo longo
      • Etapa 1: chunking do conteúdo
      • Etapa 2: mantendo o contexto com um prompt base
      • Etapa 3a: opção 1 — processamento sequencial
      • Etapa 3b: opção 2 — construindo parâmetros de prompt dinâmico
      • Etapa 4: combinando a saída – geração do relatório
      • Etapa 5: aplicar ao 10-K
      • Relatório final
      • Nossa avaliação do resumo
    • Embeddings vetoriais
      • Bancos de dados vetoriais
      • Busca vetorial
    • Reclassificação (reranking)
    • Geração de relatório
    • Desafios e limitações do RAG
  • Modelos de contexto longo: o fim do RAG?
  • Estudo de caso de LCM: geração de quiz com citações
    • Implementação
      • Prompting de Corpus-in-Context
      • Cache de prompt
      • Geração do quiz
    • Exemplo de uso
    • Discussão e limitações
  • Conclusão
  • CAPÍTULO 5: Geração de saídas estruturadas
  • Por que a saída estruturada importa
    • Melhorando a eficiência e o fluxo de trabalho do desenvolvedor
    • Atendendo a requisitos de UI e de produto
    • Melhorando a confiança e a experiência do usuário
  • Por que é difícil? A arquitetura Transformer
  • Técnicas de restrição de tempo de treinamento
  • Técnicas de restrição de tempo de inferência
    • Engenharia de prompt
    • Modo JSON (ajustado)
    • Combinando o modo JSON com o Pydantic
    • Pós-processamento de logits
    • Outlines
    • Ollama
    • Ollama com o Pydantic
    • LangChain
    • Comparando ferramentas
  • Conclusão
  • CAPÍTULO 6: Considerações de segurança dos LLMs
  • Riscos gerais de segurança da IA
  • Riscos de segurança específicos dos LLMs
    • Jailbreaking
    • Injeção de prompt (prompt crafting)
    • Edição furtiva
  • Considerando os riscos de segurança das LLMBAs
    • Prevenção contra desinformação
    • Prevenção contra conselhos não qualificados
    • Detecção de viés
    • Proteção de privacidade
  • Diretrizes de laboratórios de IA e centros de políticas
    • OpenAI
    • Anthropic
    • Google
    • Benchmark de segurança de IA da MLCommons
    • Critérios do Centre for the Governance of AI
  • Duas abordagens específicas para a segurança de LLMs
    • Red Teaming
    • IA Constitucional
      • Redução de danos por meio da autocrítica
      • Equilíbrio entre utilidade e segurança
      • Melhoria da transparência e da escalabilidade
  • Conclusão
  • CAPÍTULO 7: Avaliando a segurança dos LLMs
  • Avaliação de segurança com datasets de benchmark
    • SALAD-Bench
    • TruthfulQA
    • HarmBench
  • Guardrails e moderação no tempo de execução
    • NeMo Guardrails
    • Guardrails do TruLens
    • Llama Guard
    • API de moderação da Mistral
    • API de Moderação da OpenAI
  • Moderação personalizada com LLM como juiz
    • médio
    • Dataset de avaliação
      • Amostras ruins
      • Amostras boas
    • Filtros de segurança
      • Usando a API de Moderação da Mistral
      • Usando a API de Moderação da OpenAI
      • Usando um validador personalizado baseado em juiz
    • Benchmarking
  • Conclusão
  • CAPÍTULO 8: Alinhamento do LLM: um estudo de caso
  • Por que o alinhamento é necessário?
  • RLHF: um avanço decisivo que tornou os LLMs mais úteis e controláveis
    • Otimização de política proximal
    • DPO
  • Estudo de caso: alinhando um LLM a uma política
    • Ferramentas de alinhamento
    • Política educacional da Acme
    • Dataset de preferências — geração de dataset sintético
      • Prompts de usuário
      • Respostas rejeitadas
      • Respostas escolhidas
      • Geração de dataset de DPO
      • Otimização baseada em DPO
      • Preparação dos dados
    • Ajuste fino
      • Escolhas para o DPO e o ajuste fino
      • Ajuste fino em ação
      • Resultados do treinamento
      • Opção de salvar os resultados na Hugging Face
      • Vibe check
    • Avaliação do alinhamento: LLM como juiz
      • Amostra de prompts e respostas
      • Chamando o LLM juiz
      • Testando o LLM como juiz
      • Sucesso?
    • Composição do dataset de DPO
    • A escolha do modelo base
    • A metodologia de avaliação
    • O processo de ajuste fino e a escolha de parâmetros
  • Projetando um plano de segurança e alinhamento
    • Fase 1: definição de políticas
    • Fase 2: Pesquisa de usuários e identificação de riscos
    • Fase 3: Framework de avaliação
    • Fase 4: design da arquitetura de segurança
    • Fase 5: implementação e seleção de ferramentas
    • Fase 6: resposta a incidentes
    • Armadilhas comuns
  • Conclusão
  • CAPÍTULO 9: Epílogo: LLMBAs na era da queda dos custos de inferência
  • APÊNDICE: Ferramentas para implantação local de LLMs
  • Ollama
  • llama cpp
    • GPT-Generated Unified Format
    • Exemplo do llama cpp
    • llama-server
  • llamafile
  • Quantização
    • Perplexidade e divergência KL
    • Dataset de prompts
    • Exemplo de quantização
    • Resultados
    • Ferramentas locais, poder real
  • Índice remissivo
Ver sumário completo ▼

Sobre os autores

Thársis T. P. Souza

Thársis T. P. Souza é cientista da computação, autor e líder de produto de tecnologia com ênfase em IA. Já ocupou cargos de liderança em alguns dos maiores fundos de investimento de Wall Street e em startups de tecnologia do Vale do Silício. É PhD em ciência da computação pela UCL (Universidade de Londres) com mestrado (USP) e bacharelado… Ver perfil completo ▶

Jonathan K. Regenstein Jr.

Jonathan K. Regenstein Jr. construiu sua carreira na interseção entre dados, machine learning, tecnologia e gestão de ativos. É pesquisador afiliado do Financial Services Innovation Lab da Georgia Tech e conselheiro de empresas de IA em estágio inicial. Possui bacharelado pela Harvard University e doutorado em direito pela NYU School of Law.… Ver perfil completo ▶