ИИ Ресурсы — Фабио Де ЛукаИИ Ресурсы — Фабио Де Лука
Сообщество Коллекция Open Source

Awesome RAG: Исчерпывающая коллекция ресурсов по поколению с дополнением из внешних источников (Awesome Retrieval-Augmented Generation)

Полная каталогизация инструментов, фреймворков, методологий и исследований по Retrieval-Augmented Generation (RAG). Коллекция включает открытые решения, векторные базы данных, исследовательские работы, метрики оценки и образовательные материалы для разработки промышленных систем RAG.

⭐ 187 звёзд на GitHub 📦 Fork: 25 📅 Обновлено: 10 августа 2024 📜 Лицензия: MIT

Обзор

Retrieval-Augmented Generation (RAG) — это подход к обогащению языковых моделей свежей, релевантной информацией из внешних источников во время вывода. Вместо того чтобы полагаться только на знания, заложенные во время обучения модели, RAG динамически извлекает контекст из внешних баз данных и документов, что позволяет обеспечить ответы, основанные на актуальной информации, специфичной для домена, с возможностью цитирования источников.

Эта коллекция является универсальным каталогом всех крупных ресурсов, связанных с RAG, включая:

  • Открытые и коммерческие инструменты
  • Модели эмбеддингов и векторные базы данных
  • Исследовательские работы и обзоры
  • Архитектуры и передовые методики
  • Фреймворки и SDK для разработки
  • Метрики оценки и бенчмарки
  • Образовательные материалы и курсы
  • Лучшие практики безопасности и оптимизации

Открытые инструменты

Коллекция открытых решений для построения и развертывания RAG систем, включая полнофункциональные платформы и специализированные библиотеки.

Полнофункциональные платформы

  • CustomGPT.ai — Open-source SDK для создания кастомных RAG приложений с функциями корпоративного уровня, включением цитирований и предотвращением галлюцинаций
  • TrustGraph — Open-source полный стек AI решений для обеспечения суверенитета данных предприятия
  • RAGFlow — Open-source RAG движок, основанный на глубоком понимании документов
  • R2R (RAG to Riches) — Продвинутая система поиска AI с готовыми к продакшену функциями
  • FastRAG — Исследовательский фреймворк для эффективного retrieval augmented generation
  • FlashRAG — Python инструментарий для исследований RAG, включающий 36+ датасетов и 17+ алгоритмов
  • Verba — Open-source RAG приложение, полностью готовое к использованию
  • Kotaemon — Чистый и кастомизируемый UI для RAG с поддержкой документов и Q&A
  • Cognita — Open-source RAG фреймворк для модульных приложений
  • GraphRAG — Microsoft подход к RAG с использованием графов знаний
  • Nano-GraphRAG — Компактное решение GraphRAG с основными возможностями

Основные фреймворки и библиотеки

  • LangChain — Python/JavaScript агенты и цепочки для построения LLM приложений
  • LangChain4j — Версия для JVM (Java, Kotlin, Scala)
  • LlamaIndex — Загрузчики данных и индексы для связи кастомных источников с LLM
  • Haystack — Модульные конвейеры для построения продакшн RAG систем
  • Semantic Kernel — Microsoft SDK для .NET и Python разработчиков
  • DSPy — Декларативные конвейеры с автоматической оптимизацией
  • Guidance — Domain-specific language (DSL) для работы с промптами
  • Flowise — No-code визуальный конструктор для LLM потоков
  • reag — Reasoning Augmented Generation для логического вывода
  • Danswer — Внутренняя система поиска Q&A для корпоративных сетей
  • Neum — Создание и синхронизация векторных эмбеддингов в масштабе
  • GPTCache — Embedding-aware кэширование для оптимизации затрат
  • Mastra — TypeScript фреймворк AI агентов с поддержкой RAG, ассистентов и обсервейбельности для любого LLM
  • Letta (MemGPT) — Фреймворк для создания stateful приложений с долгосрочной памятью
  • Swiftide — Быстрое потоковое индексирование и запросы на Rust
  • LangGraph — Агентские DAG (направленные ациклические графы) для сложных рабочих потоков
  • Ragna — Фреймворк оркестрации RAG для управления сложными конвейерами
  • SimplyRetrieve — Легковесная чат AI платформа с кастомными знаниями

Инструменты оценки и мониторинга

  • LangFuse — Open-source инструмент для отслеживания метрик LLM, обсервейбельности и управления промптами
  • Ragas — Фреймворк для оценки конвейеров RAG с метриками качества
  • LangSmith — Платформа для построения и оценки prodaction-grade LLM приложений с мониторингом
  • Hugging Face Evaluate — Инструмент для вычисления метрик качества текста (BLEU, ROUGE и др.)
  • Weights & Biases — Отслеживание экспериментов, логирование метрик и визуализация производительности

Модели эмбеддингов и библиотеки

Коллекция современных моделей для создания векторных представлений текста, необходимых для эффективного поиска в RAG системах.

Коммерческие решения

  • OpenAI text-embedding-3 — Последнее поколение эмбеддингов от OpenAI с высокой точностью
  • Cohere Embed v3 — Продвинутые многоязычные эмбеддинги от Cohere
  • Voyage AI Embeddings — Специализированные эмбеддинги для различных доменов

Open-source модели

  • FlagEmbedding — Высокопроизводительные модели эмбеддингов с поддержкой множества задач
  • Jina Embeddings v4 — Многоязычные эмбеддинги с отличной производительностью
  • E5/GTE (MTEB) — Семейство моделей, оцененные на Massive Text Embedding Benchmark
  • SentenceTransformers — Популярная библиотека для получения embeddings из предложений и текста
  • MiniLM — Легкие и быстрые модели для edge и мобильных устройств
  • ColBERT v2 — Late interaction retrieval для эффективного поиска
  • BGE family — Семейство BAAI General Embeddings моделей
  • Nomic Embed Text — Открытые эмбеддинги с коммерческой лицензией
  • fastText — Базовый метод с использованием n-грамм символов

Проприетарные решения

Коммерческие платформы и API для построения RAG систем без необходимости самостоятельной разработки инфраструктуры.

  • CustomGPT.ai RAG API — Корпоративные агенты с гарантией отсутствия галлюцинаций и цитированиями
  • Pinecone — Полностью управляемый векторный сервис баз данных
  • LangSmith — Платформа для построения и оценки LLM приложений
  • OpenAI Assistants & Retrieval — Встроенная RAG функциональность в Assistants API
  • Vectara — GenAI API с встроенной RAG функциональностью
  • Cohere RAG — RAG решение из Cohere с поддержкой множества языков
  • AWS Knowledge Bases for Bedrock — Управляемый RAG сервис в AWS
  • Azure AI Search + RAG — Интеграция поиска и RAG в Azure
  • Google Vertex AI Search & RAG — Сервис поиска и RAG от Google Cloud
  • IBM watsonx.ai Retrieval — Корпоративное RAG решение от IBM
  • NVIDIA NeMo Retriever — NVIDIA решение для retrieval
  • Anthropic Claude Retrieval — Contextual retrieval в Claude API
  • Databricks DBRX RAG — RAG функциональность на платформе Databricks
  • Elastic Search Labs RAG blueprints — Готовые решения для Elasticsearch

Примеры от вендоров

  • Amazon Kendra — Интеллектуальный корпоративный поиск с RAG
  • Amazon Bedrock Knowledge Bases — Знаниевые базы на AWS
  • Azure AI Search — Поиск AI в Azure
  • Google Vertex AI Search — Поиск для предприятия от Google
  • LangChain × OpenAI Quickstart — Интеграция LangChain с OpenAI
  • LangChain × Elasticsearch Blueprint — Использование Elasticsearch в LangChain
  • LlamaIndex × Vespa Guide — Масштабируемый персональный AI ассистент
  • Qdrant Hybrid Search miniCOIL — Продвинутый поиск с гибридным подходом
  • AWS Bedrock RAG Sample — Примеры реализации RAG на AWS
  • Azure RAG Jumpstart — Быстрый старт для RAG на Azure
  • GCP Vertex RAG Agent Builder — Построитель RAG агентов от Google

Векторные базы данных и поисковые движки

Специализированные системы хранения для векторных представлений и эффективного поиска подобия, являющиеся основой современных RAG систем.

Полнофункциональные векторные БД

  • Weaviate — Open-source векторная БД с GraphQL интерфейсом
  • Qdrant — Высокопроизводительный движок поиска сходства векторов
  • Milvus — Open-source векторная БД для масштабируемого поиска
  • Chroma — Open-source база эмбеддингов для LLM приложений
  • Pinecone — Управляемый векторный сервис с высокой производительностью
  • Elasticsearch (vector) — Распределённый поиск и аналитика с поддержкой векторов
  • OpenSearch — Open source распределённый поисковый движок
  • Vespa — AI + Data платформа для онлайн приложений
  • SurrealDB — Масштабируемая мультимодельная БД с поддержкой временных рядов

Интеграция в существующие БД

  • PGVector — PostgreSQL расширение для поиска сходства векторов
  • Redis Stack Search — Поиск и запросы в Redis данных
  • ClickHouse Vectors — Поддержка векторного поиска в ClickHouse
  • Oracle AI Vector Search — Векторный поиск в Oracle Database
  • TiDB Vector — Поиск семантического сходства в TiDB
  • Azure Cosmos DB — Глобально распределённая БД с векторным поиском
  • Couchbase — Распределённая NoSQL облачная БД
  • Neo4j — Система управления графовой БД с векторным индексом
  • Redis Stack — In-memory структура данных для DB, кэша и сообщений
  • Lantern.dev — Open-source Postgres векторная БД

Специализированные алгоритмы поиска

  • ScaNN — Scalable Nearest Neighbors метод для эффективного поиска подобных векторов
  • LlamaIndex — Простое в памяти хранилище векторов для быстрого экспериментирования

Исследовательские работы и обзоры

Академические работы, определившие RAG область и продолжающие её развитие с новыми методиками и архитектурами.

Фундаментальные работы

  • Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020) — Оригинальная RAG работа Патрика Льюиса с командой из Facebook
  • REALM: Retrieval-Augmented Language Model Pre-Training (2020) — Фундаментальная работа Google по retrieval-augmented pre-training
  • Dense Passage Retrieval for Open-Domain Question Answering (2020) — DPR система Facebook для плотного поиска
  • Fusion-in-Decoder (FiD) — Метод слияния информации из множественных документов

Продвинутые архитектуры

  • RETRO (Retrieval-Enhanced Transformer) (2022) — DeepMind подход с триллионами токенов
  • Atlas: Few-shot Learning with Retrieval Augmented Language Models (2022) — Meta система для few-shot обучения
  • ColBERT: Efficient Late Interaction Retrieval (2021) — Мультивекторный плотный поиск с поздним взаимодействием

Комплексные обзоры RAG

  • Retrieval-Augmented Generation for Large Language Models: A Survey (2023) — Полный обзор, охватывающий Naive RAG, Advanced RAG и Modular RAG
  • A Comprehensive Survey of Retrieval-Augmented Generation (RAG) (2024) — 2024 обзор эволюции RAG от основ к современности
  • Retrieval-Augmented Generation for AI-Generated Content: A Survey (2024) — Комплексный обзор техник RAG для AIGC сценариев
  • Evaluation of Retrieval-Augmented Generation: A Survey (2024) — Обзор методологий оценки RAG

Обзоры 2022

  • A Survey on Retrieval-Augmented Text Generation (2022) — Ранний комплексный обзор RAG

Обзоры 2023

  • Retrieving Multimodal Information for Augmented Generation: A Survey (2023) — Мультимодальный RAG
  • Retrieval-Augmented Generation for Large Language Models: A Survey (2023) — Основной обзор года

Обзоры 2024

  • Retrieval-Augmented Generation for AI-Generated Content: A Survey (2024)
  • A Survey on Retrieval-Augmented Text Generation for Large Language Models (2024)
  • RAG and RAU: A Survey on Retrieval-Augmented Language Model in Natural Language Processing (2024)
  • A Survey on RAG Meeting LLMs: Towards Retrieval-Augmented Large Language Models (2024)
  • Evaluation of Retrieval-Augmented Generation: A Survey (2024)
  • Retrieval-Augmented Generation for Natural Language Processing: A Survey (2024)
  • Graph Retrieval-Augmented Generation: A Survey (2024)
  • Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey (2024) — Как сделать LLM более мудрыми в использовании внешних данных
  • A Comprehensive Survey of Retrieval-Augmented Generation (RAG): Evolution, Current Landscape and Future Directions (2024)

Специализированные исследования

  • Benchmarking LLMs in RAG (2024) — Оценка производительности LLM в RAG сценариях
  • Reliable, Adaptable & Attributable LMs with Retrieval (2024) — Надёжность и атрибутируемость
  • GraphRAG (2024) — Microsoft Research подход с графами знаний
  • RAG-Fusion (2024) — Meta подход к комбинированию техник retrieval
  • Look-ahead Retrieval (2025) — OpenAI инновация для предсказательного поиска

Фреймворки для RAG разработки

Полнофункциональные платформы и библиотеки для систематического построения RAG приложений.

  • LangChain — Фреймворк для построения LLM приложений с цепочками и агентами
  • LlamaIndex — Фреймворк для связи кастомных источников данных с LLM
  • Haystack — Полнофункциональный фреймворк для построения production-ready LLM приложений
  • DSPy — Фреймворк для программирования языковых моделей с автоматической оптимизацией
  • Dify — Open-source платформа для разработки LLM приложений с RAG конвейером
  • Semantic Kernel — Microsoft SDK для разработки приложений Generative AI
  • Flowise — Drag & drop UI для построения кастомных LLM потоков
  • Cognita — Open-source RAG фреймворк для модульных и production-ready приложений
  • Verba — Open-source приложение для RAG out of the box
  • Mastra — Typescript фреймворк для построения AI приложений
  • Letta — Open source фреймворк для построения stateful LLM приложений
  • Swiftide — Rust фреймворк для построения модульных потоковых LLM приложений
  • CocoIndex — ETL фреймворк для индексирования данных для AI и RAG с реальными инкрементальными обновлениями

Техники и методологии RAG

Передовые методы и подходы для оптимизации различных компонентов RAG систем.

Ключевые техники

  • HyDE (Hypothetical Document Embeddings) — Использование LLM для генерации гипотетических документов для запросов
  • FLARE (Forward-Looking Active REtrieval) — Итеративный поиск документов на основе уверенности предсказания
  • Self-RAG — Обучение LLM адаптивно извлекать документы и самокритиковать себя
  • CRAG (Corrective Retrieval Augmented Generation) — Улучшение надёжности генерации с оценщиком поиска
  • Agentic RAG — Агенты поиска, автономно решающие когда и как искать информацию
  • Cache-Augmented Generation (CAG) — Предварительная загрузка документов в контекст модели с сохранением KV кэша
  • Retrieval-Augmented Fine-Tuning (RAFT) — Fine-tuning моделей специально для улучшения поиска и генерации
  • Self-Reflective RAG — Системы, мониторящие собственные выходы и динамически корректирующие поиск
  • RAG Fusion — Комбинирование множественных техник поиска для более богатого контекста
  • Temporal Augmented Retrieval (TAR) — Учёт временных сигналов для релевантности данных
  • Plan-then-RAG (PlanRAG) — Сначала план высокого уровня, затем retrieval-augmented генерация
  • GraphRAG — Использование графов знаний для структурирования контекста
  • FLARE — Active итеративный поиск для прогрессивного улучшения
  • Contextual Retrieval — Обогащение фрагментов документов контекстом перед поиском
  • GNN-RAG — Применение графовых нейронных сетей для лучшего рассуждения
  • RePlug — Retriever-aware генерация
  • Streaming RAG — Низколатентный RAG для приложений в реальном времени

Мультимодальный RAG

  • Multimodal RAG with CLIP — Поиск текста и изображений с использованием CLIP
  • SAM-RAG — Self-adaptive мультимодальный RAG фреймворк
  • ColPali — Эффективный поиск документов с vision language моделями
  • Building Multimodal RAG Systems — Практическое руководство

Graph-based RAG

  • Microsoft GraphRAG — Подход с использованием графов знаний, с исследованием в GraphRAG Paper
  • Knowledge Graph Integration for RAG — Интеграция графов знаний в RAG
  • Neo4j GraphRAG — Построение графов знаний для RAG с Neo4j

Методы поиска (Retrieval Methods)

Различные подходы к поиску релевантных документов и информации для RAG системы.

Плотный поиск (Dense Retrieval)

  • Dense Passage Retrieval (DPR) — Facebook система плотного поиска отрывков
  • ColBERTv2: Effective and Efficient Retrieval — Эффективный и результативный поиск

Разреженный поиск (Sparse Retrieval)

  • SPLADE: Sparse Lexical and Expansion Model — Нейронный разреженный поиск с расширением терминов
  • HNSW vs DiskANN — Сравнение алгоритмов

Гибридный поиск (Hybrid Search)

  • Hybrid Search: Combining Dense and Sparse Retrieval — Руководство по реализации
  • Dense-Sparse-Dense (DSD) — Трёхуровневый подход
  • Advanced Reranking Techniques — Использование cross-encoder reranking

Прочие техники поиска

  • RAG Fusion — Слияние результатов множественных поисков
  • Sentence Window Retrieval — Поиск с расширением контекста предложений
  • Cross-Encoder Re-Ranking — Переранжирование результатов cross-encoder моделью
  • Gemini Small-to-Big Retriever — Двухуровневый поиск от Google
  • Multi-Vector Retrieval — Использование множественных векторов на документ
  • Negative PRF (Pseudo-Relevance) — Использование отрицательной обратной связи

Разбиение и предобработка текста (Chunking & Pre-processing)

Методы оптимального разделения и подготовки документов для RAG систем.

Стратегии разбиения

  • 11 Chunking Strategies for RAG — Полное руководство по 11 методам разбиения с визуализацией
  • 5 Levels of Text Splitting — Иерархический подход от базового к продвинутому
  • Semantic Chunking with LlamaIndex — Семантическое разбиение на основе смысла
  • Optimizing Retrieval-Augmented Generation with Advanced Chunking — Исследование оптимальных размеров
  • CharacterTextSplitter — Разбиение по фиксированному размеру
  • RecursiveTextSplitter — Рекурсивное разбиение с соблюдением структуры
  • SentenceSplitter (LlamaIndex) — Разбиение по предложениям

Инструменты и библиотеки

  • Unstructured-IO loaders — Загрузчики для работы с неструктурированными данными
  • LoRA Chunking — Fused kernel chunk loss для сокращения памяти
  • Chunking Strategies for LLM Applications — Практические стратегии
  • Evaluating the Ideal Chunk Size for a RAG System — Оценка оптимального размера
  • How to Chunk Text Data — A Comparative Analysis — Сравнительный анализ методов

Обучающие материалы

  • Semantic chunking video — Видеоруководство
  • Agentic chunking demo — Демонстрация агентского разбиения
  • The 5 Levels Of Text Splitting For Retrieval — Видео с разбором уровней

Сравнительные руководства

  • Vector Database Comparison — Сравнение Pinecone vs Weaviate vs Chroma
  • Top Vector Database for RAG — Сравнение Qdrant vs Weaviate vs Pinecone с метриками

Стратегии промптинга для RAG

Методы написания и оптимизации промптов для эффективного использования в RAG системах.

Основные руководства

  • RAG Prompt Engineering Guide (DAIR.AI) — Комплексное руководство по промптингу для RAG
  • LangChain RAG Prompt Hub — Коллекция протестированных шаблонов промптов
  • Efficient Prompt Engineering for RAG — Стратегии оптимизации промптов
  • Secure RAG applications using prompt engineering — Лучшие практики безопасности

Техники промптинга

  • Zero-Shot / Few-Shot — Обучение без или с минимальными примерами
  • Chain-of-Thought (CoT) — Пошаговое рассуждение
  • Meta Prompting — Промпты о промптах
  • Generated Knowledge Prompting — Генерация знаний в промпте
  • ReAct — Reason + Act парадигма
  • Reflexion — Самоанализ и корректировка
  • Automatic Prompt Engineer (APE) — Автоматическая генерация промптов
  • Directional Stimulus Prompting (DSP) — Направленные стимулы
  • Chain-of-Verification (CoVe) — Цепочка проверки
  • Self-Consistency — Множественные пути к одному ответу
  • Prompt Compression — Сжатие промптов для снижения стоимости
  • Dynamic / Adaptive Prompts — Адаптивные промпты
  • System → Retrieval → User triple-prompt — Архитектура тройного промпта
  • GraphPrompt — Использование графов в промптах

Продвинутые методологии

  • Emerging RAG & Prompt Engineering Architectures — Новые архитектуры
  • How to Cut RAG Costs by 80% — Сжатие промптов для оптимизации

Оценка и бенчмарки

Методологии и инструменты для измерения качества и производительности RAG систем.

Фреймворки оценки

  • RAGAS (Retrieval-Augmented Generation Assessment) — Безопасный от ссылок фреймворк с компонентными метриками
  • TruLens — Комплексная оценка и отслеживание LLM приложений
  • DeepEval — Open-source фреймворк оценки для LLM
  • Arize Phoenix — Open-source платформа обсервейбельности
  • RAGBench — 100k примеров из 5 промышленных доменов
  • BeIR — Бенчмарк zero-shot оценки информационного поиска
  • MTEB — Massive Text Embedding Benchmark
  • ARES — Automated Evaluation of RAG Systems
  • RGB Benchmark — Бенчмарк для оценки LLM в RAG
  • LlamaIndex RAG eval — Инструменты оценки и бенчмаркинга

Блоги и статьи по оценке

  • RAG Evaluation — Обзор методов оценки
  • Evaluating RAG: A journey through metrics — Путешествие через метрики
  • Exploring End-to-End Evaluation of RAG Pipelines — Комплексная оценка
  • Evaluation Driven Development — Swiss Army Knife для RAG конвейеров
  • Evaluating the Ideal Chunk Size — Оценка размера чанков

Бенчмарки 2023

  • Benchmarking Large Language Models in Retrieval-Augmented Generation
  • RECALL: A Benchmark for LLMs Robustness — Устойчивость к контрфактическим знаниям
  • ARES: An Automated Evaluation Framework
  • RAGAS: Automated Evaluation of Retrieval Augmented Generation

Бенчмарки 2024

  • CRUD-RAG: A Comprehensive Chinese Benchmark — Бенчмарк на китайском языке
  • FeB4RAG: Evaluating Federated Search — Оценка федерального поиска
  • CodeRAG-Bench: Can Retrieval Augment Code Generation? — Бенчмарк для кода
  • Long²RAG: Evaluating Long-Context & Long-Form — Для долгого контекста

Безопасность и приватность

Методы и лучшие практики для защиты RAG систем от уязвимостей и утечек данных.

Фреймворки безопасности

  • OWASP Top 10 for LLM Applications — Комплексный фреймворк безопасности
  • CSA RAG Security Best Practices — Корпоративные контролы безопасности
  • Microsoft Presidio for PII Protection — Фреймворк для определения и анонимизации PII
  • LLM Guard — Набор инструментов безопасности для защиты LLM
  • Guardrails AI — Фреймворк для реализации guardrails безопасности
  • NVIDIA NeMo Guardrails — Комплексный набор инструментов programmable guardrails

Практические применения

  • Masking PII Data in RAG Pipeline — Маскирование личных данных
  • Hijacking Chatbots: Dangerous Methods — Анализ методов манипуляции GPT
  • NeMo Guardrails: The Missing Manual — Руководство по guardrails
  • Safeguarding LLMs with Guardrails — Практика защиты LLM

Производительность, стоимость и обсервейбельность

Инструменты и методы для мониторинга, оптимизации и управления затратами RAG систем.

Оптимизация производительности

  • Vector Database Optimization — Техники эффективного хранения векторов
  • Hybrid Retrieval Strategies — Комбинирование методов поиска
  • Chunking Optimization — Стратегии оптимального разбиения

Платформы мониторинга

  • LangFuse — Телеметрия и отслеживание
  • LangSmith — Платформа для разработки и оценки
  • Helicone — Телеметрия для LLM приложений
  • WandB RAG guide — Weights & Biases для RAG
  • OpenLLMetry — Open-source обсервейбельность на основе OpenTelemetry

Оптимизация стоимости

  • Cost optimisation tips — Секреты оптимизации стоимости и производительности
  • RAG Cost Calculator — Инструмент для расчёта и оптимизации затрат
  • RAG Savings Calculator — Калькулятор экономии
  • RAG Cost Calculator (Zilliz) — Альтернативный калькулятор затрат

Fine-tuning и обучение для RAG

Методы адаптации и обучения моделей специально для RAG приложений.

Подходы к оптимизации

  • RA-DIT — Retrieval-Augmented Dense Image Tokens
  • InstructRetro — Instruction-tuning для retrieval
  • FLARE / Active RAG — Активное обучение
  • UltraFeedback — RLHF для RAG
  • DSI-T — Decoder-only retrieval

Fine-tuning практика

  • Fine-Tuning Llama 2.0 with Single GPU Magic — QLoRA для эффективного fine-tuning
  • Practitioners guide to fine-tune LLMs — Практическое руководство
  • Are You Pre-training your RAG Models — Pre-training на raw текте
  • Combine Multiple LoRA Adapters — Комбинирование LoRA адаптеров
  • RAG vs Finetuning — Выбор лучшего инструмента

Специализированный RAG fine-tuning

  • RAFT (Retrieval Augmented Fine-Tuning) — Адаптирование моделей к доменным RAG
  • Fine-tuning vs RAG Guide — Комплексное сравнение
  • Direct Preference Optimization (DPO) for RAG — Альтернатива RLHF

Graph-based и структурированное RAG

Использование графов знаний и структурированных данных для построения более интеллектуальных RAG систем.

Знаниевые графы (Knowledge Graphs)

  • DBpedia — Структурированные знания из Wikipedia
  • Wikidata — Поддерживаемая сообществом база знаний
  • ConceptNet — Крупномасштабный граф здравого смысла
  • YAGO — Высококачественная база знаний

Инструменты для GraphRAG

  • Neo4j LLM Knowledge Graph Builder — Построитель графов из текста
  • Neo4j RAG blog — Практические примеры
  • GraphRAG site — Официальный сайт проекта
  • NebulaGraph Graph-RAG article — Новый стек LLM с графами знаний

Библиотеки и SDK

Утилиты и инструменты для ускорения разработки RAG приложений.

  • Sentence Transformers — Python фреймворк для эмбеддингов предложений и текста
  • LiteLLM — Python SDK для 100+ LLM API в OpenAI формате
  • AI SDK — TypeScript набор инструментов для AI приложений
  • Hugging Face Transformers — SOTA ML для PyTorch, TensorFlow и JAX

Образовательные материалы

Курсы, руководства и ресурсы для обучения RAG разработке.

Курсы и онлайн обучение

  • Building Advanced RAG (DeepLearning.AI) — Продвинутый курс от DeepLearning.AI
  • RAG from Scratch (FreeCodeCamp) — Бесплатный курс с нуля
  • IBM Generative AI and RAG Course (Coursera) — Курс от IBM
  • MAGMaR 2024 (NeurIPS) — Multimodal Augmented Generation Workshop
  • ACL 2024 Knowledgeable LMs Tutorial — Академический튜토리얼
  • SIGIR 2023 Generative IR Workshop — Генеративный информационный поиск

Специализированные туториалы

  • Towards Knowledgeable Language Models — От JHU NLP
  • Modular RAG and RAG Flow — Двухчастное руководство Yunfan Gao (2024)
  • Stanford CS25: V3 I Retrieval Augmented Language Models — Лекция Douwe Kiela (2023)
  • Building RAG-based LLM Applications for Production — Anyscale руководство (2023)
  • Multi-Vector Retriever for RAG — LangChain туториал (2023)
  • Retrieval-based Language Models and Applications — ACL туториал (2023)
  • Advanced RAG Techniques: an Illustrated Overview — Ivan Ilin (2023)
  • Retrieval Augmented Language Modeling — Melissa Dell лекция (2023)

Видеоматериалы

  • RAG from scratch — GitHub репозиторий с примерами
  • Building RAG Applications for Production — Ray Project примеры
  • Ray Summit 2024: Production RAG Pipelines — Плейлист видео
  • Haystack RAG Workshop — Практический workshop
  • Azure Cognitive Search RAG Tutorial — Microsoft обучение

Блоги и статьи

  • RAG Implementation with LangChain and Weaviate — От теории к практике
  • Advanced RAG Techniques: An Illustrated Overview — Визуальное руководство
  • The RAGOps Stack: Critical Components — Архитектура RAG операций
  • Knowledge Graphs for RAG — Курс DeepLearning.AI
  • RAG Intuitively & Exhaustively Explained — Полное объяснение
  • RAG in Production: 9 Lessons — Практические уроки
  • Reranking vs Embeddings on Cursor — Сравнение подходов
  • Forget RAG, Think RAG-Fusion — Новые подходы
  • Hidden Costs of RAG — Анализ недостатков

Сообщества и форумы

  • ragaboutit — Блог и рассылка о RAG новостях
  • r/LangChain — Reddit сообщество LangChain
  • r/rag — Дедицированный RAG subreddit

Конференции и выступления

  • Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — NeurIPS 2020
  • Self-RAG: Learning to Retrieve, Generate, and Critique — ICLR 2024
  • RAG Research Papers Collection — Куратор список из ICML, ICLR, ACL

Влиятельные исследователи и эксперты

Ключевые фигуры, определившие направление развития RAG технологии.

  • Patrick Lewis — Главный автор оригинальной RAG работы, AI Research Scientist в Cohere
  • Sebastian Riedel — Co-автор RAG работы, Professor в UCL и DeepMind
  • Douwe Kiela — Co-автор RAG работы, CEO Contextual AI, эксперт по модульному RAG
  • Gautier Izacard — Автор FiD и Atlas работ, Meta AI
  • Kelvin Guu — Lead автор REALM работы, Google Research
  • Matei Zaharia — DSPy, Databricks
  • Akari Asai — Исследователь плотного поиска
  • Jerry Liu — LlamaIndex creator
  • Harrison Chase — LangChain creator
  • Andrej Karpathy — LLM системы эксперт
  • Jeff Dean — Google Research руководитель
  • Artem Yankov — Qdrant creator
  • Alden Do Rosario — RAG influencer, CEO CustomGPT.ai

Ресурсы сообщества

Места для взаимодействия, обучения и обмена знаниями с RAG сообществом.

Reddit сообщества

  • r/LocalLLaMA — 493k членов, обсуждения локальных LLM
  • r/MachineLearning — Активные обсуждения RAG
  • r/RAG — Дедицированный RAG subreddit

Discord сообщества

  • RAG TAGG Discord — 2,492 членов
  • Vectara RAGTime Bot — RAG-powered бот для Slack и Discord
  • RAGHub Community — Сообщество вокруг RAGHub

GitHub сообщества и репозитории

  • RAGHub Repository — Коллекция RAG ресурсов
  • Microsoft GraphRAG — Официальный репозиторий GraphRAG
  • Awesome-RAG (awesome-rag) — Основной awesome список
  • RAG Resources (mrdbourke) — Куратированные ресурсы
  • RAG Techniques (NirDiamant) — Техники с реализацией
  • Danielskry / Awesome-RAG — Альтернативный awesome список
  • frutik / Awesome-RAG — Ещё один awesome список
  • coree / awesome-rag — Кураторский список
  • jxzhangjhu / Awesome-LLM-RAG — LLM-focused ресурсы
  • SJTU-DMTai / awesome-rag — Синьцзянский университет версия
  • lucifertrj / Awesome-RAG — Персональная коллекция

Часто задаваемые вопросы

Что такое Retrieval-Augmented Generation (RAG)?

RAG — это техника, которая обогащает языковые модели свежей, релевантной информацией путём извлечения контекста из внешних источников данных во время вывода модели. Вместо полного полагания на знания, заложенные при обучении модели, RAG динамически извлекает документы и информацию, что позволяет давать более точные, актуальные ответы с указанием источников.

Какая разница между RAG и fine-tuning?

RAG добавляет внешние знания во время вывода через поиск документов, а fine-tuning адаптирует саму модель путём переобучения на специализированных данных. RAG лучше для динамических данных и когда нужны актуальные факты, fine-tuning — когда нужно встроить специфичные для домена стили и знания в модель. Часто лучше комбинировать оба подхода.

Какие основные компоненты RAG системы?

Типичная RAG система состоит из: (1) Retriever — компонент поиска релевантных документов; (2) Vector Database — хранилище эмбеддингов документов; (3) Embedding Model — модель для преобразования текста в векторы; (4) Query Processor — обработка пользовательского запроса; (5) LLM — языковая модель для генерации ответа; (6) Aggregator — комбинирование найденных документов с генерацией ответа.

Как выбрать подходящий размер чанка для документов?

Оптимальный размер чанка зависит от вашего случая использования. Типично используются размеры от 128 до 512 токенов. Меньшие чанки (128-256) лучше для точного поиска конкретной информации, а большие (512+) — для сохранения контекста. Рекомендуется экспериментировать и оценивать производительность на вашем датасете.

Что такое гибридный поиск и когда его использовать?

Гибридный поиск комбинирует плотный поиск (используя эмбеддинги) со разреженным поиском (используя ключевые слова). Плотный поиск хорош для семантического сходства, разреженный — для точного совпадения ключевых слов. Гибридный подход использует оба, обеспечивая лучшие результаты. Рекомендуется для большинства production RAG систем.

Как измерить качество RAG системы?

Основные метрики для оценки RAG: (1) Context Relevance — релевантность извлечённых документов запросу; (2) Groundedness — заземлённость ответа в найденных документах; (3) Answer Relevance — релевантность ответа оригинальному запросу; (4) Faithfulness — насколько ответ основан на контексте; (5) Semantic Similarity — семантическое сходство ответа с ожиданиями. Используйте фреймворки как RAGAS для автоматизированной оценки.

Полезные ссылки

Esc