Skip to main content
Reference for config.yaml. Environment placeholders like ${VAR_NAME} resolve at runtime.

Top-level Keys

  • sources: connector list for ingestion jobs
  • embedding: embedding provider + model config
  • inference: LLM provider + model config for rephrase/chat tasks
  • vector_store: chunking and pgvector/HNSW settings

sources

Each item:
Connector config fields differ by connector type. See connector pages for exact keys.

Common Connector Fields

The following fields are supported by all connector types:

embedding

  • provider: embedding backend
  • model_config: model id/name used by provider
  • embedding_dim: vector dimension returned by model
WARNING: once embedding dimension is set, it cannot be changed without rebuilding the index.

inference

  • provider: inference backend
  • model_config: chat/rephrase model id
NOTE: inference backend is not used for vector search, only for the rephrase endpoint.

vector_store

  • table_name: embeddings table name
  • hybrid_search: vector + keyword retrieval toggle
  • chunk_size: chunk size for indexing
  • chunk_overlap: overlap between adjacent chunks
  • hnsw.hnsw_m: graph neighbors per node
  • hnsw.hnsw_ef_construction: index build quality/speed tradeoff
  • hnsw.hnsw_ef_search: search recall/speed tradeoff
  • hnsw.hnsw_dist_method: vector distance operator