diff --git a/conf/models/302ai.json b/conf/models/302ai.json index 1ac370c6a2..d1e11c465f 100644 --- a/conf/models/302ai.json +++ b/conf/models/302ai.json @@ -293,7 +293,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 16384 }, { "name": "jina-reranker-v2-base-multilingual", diff --git a/conf/models/aliyun.json b/conf/models/aliyun.json index 0f4c845149..01c2e92349 100644 --- a/conf/models/aliyun.json +++ b/conf/models/aliyun.json @@ -30,7 +30,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 10 }, { "name": "qwen3-vl-plus", @@ -67,7 +68,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 10 }, { "name": "qwen3-rerank", diff --git a/conf/models/astraflow.json b/conf/models/astraflow.json index 6b33a8fd0e..97f246edfb 100644 --- a/conf/models/astraflow.json +++ b/conf/models/astraflow.json @@ -18,7 +18,8 @@ "max_tokens": 16384, "model_types": [ "embedding" - ] + ], + "batch_size": 512 }, { "name": "bge-reranker-v2-m3", diff --git a/conf/models/baichuan.json b/conf/models/baichuan.json index cfe927d32f..c69be2ba1b 100644 --- a/conf/models/baichuan.json +++ b/conf/models/baichuan.json @@ -124,7 +124,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 16 } ] } diff --git a/conf/models/baidu.json b/conf/models/baidu.json index 726ffddaa1..e86119b9b1 100644 --- a/conf/models/baidu.json +++ b/conf/models/baidu.json @@ -88,7 +88,8 @@ "max_tokens": 384, "model_types": [ "embedding" - ] + ], + "batch_size": 16 }, { "name": "qwen3-reranker-4b", diff --git a/conf/models/bedrock.json b/conf/models/bedrock.json index 69a94e7eac..954e92f258 100644 --- a/conf/models/bedrock.json +++ b/conf/models/bedrock.json @@ -132,35 +132,40 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 1 }, { "name": "amazon.titan-embed-text-v1", "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 1 }, { "name": "cohere.embed-english-v3", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 96 }, { "name": "cohere.embed-multilingual-v3", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 96 }, { "name": "cohere.embed-v4:0", "max_tokens": 128000, "model_types": [ "embedding" - ] + ], + "batch_size": 96 } ] } diff --git a/conf/models/cohere.json b/conf/models/cohere.json index 244c9a6b2b..cd943f3cb6 100644 --- a/conf/models/cohere.json +++ b/conf/models/cohere.json @@ -117,35 +117,40 @@ "max_tokens": 131072, "model_types": [ "embedding" - ] + ], + "batch_size": 96 }, { "name": "embed-english-v3.0", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 96 }, { "name": "embed-english-light-v3.0", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 96 }, { "name": "embed-multilingual-v3.0", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 96 }, { "name": "embed-multilingual-light-v3.0", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 96 }, { "name": "cohere-transcribe-03-2026", diff --git a/conf/models/cometapi.json b/conf/models/cometapi.json index 62957a4d71..e316de475f 100644 --- a/conf/models/cometapi.json +++ b/conf/models/cometapi.json @@ -124,21 +124,24 @@ "max_tokens": 8191, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "text-embedding-3-large", "max_tokens": 8191, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "text-embedding-ada-002", "max_tokens": 8191, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "whisper-1", diff --git a/conf/models/deepinfra.json b/conf/models/deepinfra.json index 4269ba3e0a..aa4387a0d7 100644 --- a/conf/models/deepinfra.json +++ b/conf/models/deepinfra.json @@ -34,7 +34,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 1024 }, { "name": "hexgrad/Kokoro-82M", diff --git a/conf/models/gitee.json b/conf/models/gitee.json index 7ae3ea2dda..035be6ce1d 100644 --- a/conf/models/gitee.json +++ b/conf/models/gitee.json @@ -63,7 +63,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 32 }, { "name": "GOT-OCR2_0", @@ -87,7 +88,8 @@ "name": "jina-clip-v2", "model_types": [ "embedding" - ] + ], + "batch_size": 16384 }, { "name": "HunyuanOCR", diff --git a/conf/models/google.json b/conf/models/google.json index 86ab91d47d..f3d14de163 100644 --- a/conf/models/google.json +++ b/conf/models/google.json @@ -29,7 +29,8 @@ "max_tokens": 2048, "model_types": [ "embedding" - ] + ], + "batch_size": 100 } ], "features": { diff --git a/conf/models/greenpt.json b/conf/models/greenpt.json index c9b1a48da9..9808b4bc57 100644 --- a/conf/models/greenpt.json +++ b/conf/models/greenpt.json @@ -43,7 +43,8 @@ ], "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "green-rerank", diff --git a/conf/models/huaweicloud.json b/conf/models/huaweicloud.json index 2a5f5d802a..310a85f6f2 100755 --- a/conf/models/huaweicloud.json +++ b/conf/models/huaweicloud.json @@ -218,7 +218,8 @@ "max_tokens": 8000, "model_types": [ "embedding" - ] + ], + "batch_size": 32 }, { "name": "bge-reranker-v2-m3", diff --git a/conf/models/hunyuan.json b/conf/models/hunyuan.json index a1ea4bcef1..2a2bcfe186 100644 --- a/conf/models/hunyuan.json +++ b/conf/models/hunyuan.json @@ -364,28 +364,32 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 50 }, { "name": "kinfra-text-embedding-4b", "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 50 }, { "name": "kinfra-vl-embedding-2b", "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 50 }, { "name": "kinfra-vl-embedding-8b", "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 50 } ] } diff --git a/conf/models/jiekouai.json b/conf/models/jiekouai.json index 9deac93df9..a4c2320eb4 100644 --- a/conf/models/jiekouai.json +++ b/conf/models/jiekouai.json @@ -128,7 +128,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 } ] } diff --git a/conf/models/jina.json b/conf/models/jina.json index ca934930d7..28f2991ebb 100644 --- a/conf/models/jina.json +++ b/conf/models/jina.json @@ -56,56 +56,64 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 16384 }, { "name": "jina-embeddings-v4", "max_tokens": 32768, "model_types": [ "embedding" - ] + ], + "batch_size": 16384 }, { "name": "jina-embeddings-v5-text-small", "max_tokens": 32768, "model_types": [ "embedding" - ] + ], + "batch_size": 16384 }, { "name": "jina-embeddings-v5-text-nano", "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 16384 }, { "name": "jina-embeddings-v5-omni-small", "max_tokens": 32768, "model_types": [ "embedding" - ] + ], + "batch_size": 16384 }, { "name": "jina-embeddings-v5-omni-nano", "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 16384 }, { "name": "jina-clip-v2", "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 16384 }, { "name": "jina-embeddings-v2-base-en", "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 16384 } ] } diff --git a/conf/models/mistral.json b/conf/models/mistral.json index f140e337e7..616b62db54 100644 --- a/conf/models/mistral.json +++ b/conf/models/mistral.json @@ -174,7 +174,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 16 }, { "name": "mistral-ocr-2512", diff --git a/conf/models/n1n.json b/conf/models/n1n.json index ce5f011e7d..8a34da2a28 100644 --- a/conf/models/n1n.json +++ b/conf/models/n1n.json @@ -119,21 +119,24 @@ "max_tokens": 8191, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "text-embedding-3-large", "max_tokens": 8191, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "text-embedding-ada-002", "max_tokens": 8191, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "BAAI/bge-reranker-v2-m3", diff --git a/conf/models/novita.json b/conf/models/novita.json index bddaaae858..d2a5fa7e18 100644 --- a/conf/models/novita.json +++ b/conf/models/novita.json @@ -94,7 +94,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "baai/bge-reranker-v2-m3", diff --git a/conf/models/nvidia.json b/conf/models/nvidia.json index 9d4ee14d64..05c7fb39b4 100644 --- a/conf/models/nvidia.json +++ b/conf/models/nvidia.json @@ -234,7 +234,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 32 }, { "name": "nvidia/nemotron-3-nano-30b-a3b", @@ -315,14 +316,16 @@ "max_tokens": 32768, "model_types": [ "embedding" - ] + ], + "batch_size": 32 }, { "name": "nvidia/nv-embedcode-7b-v1", "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 32 }, { "name": "nvidia/nvidia-nemotron-nano-9b-v2", diff --git a/conf/models/openai.json b/conf/models/openai.json index 1f3e2ffd73..0c15f86ab8 100644 --- a/conf/models/openai.json +++ b/conf/models/openai.json @@ -255,21 +255,24 @@ "max_tokens": 8191, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "text-embedding-3-small", "max_tokens": 8191, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "text-embedding-3-large", "max_tokens": 8191, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "whisper-1", diff --git a/conf/models/perplexity.json b/conf/models/perplexity.json index 793d3e2ebc..961976ec19 100644 --- a/conf/models/perplexity.json +++ b/conf/models/perplexity.json @@ -51,14 +51,16 @@ "max_tokens": 32000, "model_types": [ "embedding" - ] + ], + "batch_size": 512 }, { "name": "pplx-embed-v1-4b", "max_tokens": 32000, "model_types": [ "embedding" - ] + ], + "batch_size": 512 } ] } diff --git a/conf/models/ppio.json b/conf/models/ppio.json index 5886b2acc7..6ce4441328 100644 --- a/conf/models/ppio.json +++ b/conf/models/ppio.json @@ -247,19 +247,22 @@ "name": "qwen/qwen3-embedding-8b", "model_types": [ "embedding" - ] + ], + "batch_size": 32 }, { "name": "baai/bge-m3", "model_types": [ "embedding" - ] + ], + "batch_size": 32 }, { "name": "qwen/qwen3-embedding-0.6b", "model_types": [ "embedding" - ] + ], + "batch_size": 32 }, { "name": "baai/bge-reranker-v2-m3", diff --git a/conf/models/replicate.json b/conf/models/replicate.json index ca60f57537..103eb9b2e6 100644 --- a/conf/models/replicate.json +++ b/conf/models/replicate.json @@ -47,14 +47,16 @@ "max_tokens": 384, "model_types": [ "embedding" - ] + ], + "batch_size": 16 }, { "name": "ibm-granite/granite-embedding-278m-multilingual:1f76d42a05f120e12272746d5a2d86b525c13420773f795a4cbef9117d8685f1", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 16 } ] } diff --git a/conf/models/siliconflow.json b/conf/models/siliconflow.json index fb1c07d1c5..1af3894b72 100644 --- a/conf/models/siliconflow.json +++ b/conf/models/siliconflow.json @@ -120,7 +120,8 @@ "max_tokens": 8192, "model_types": [ "embedding" - ] + ], + "batch_size": 32 }, { "name": "BAAI/bge-m3", @@ -129,7 +130,8 @@ "embedding" ], "max_dimension": 1024, - "dimensions": [] + "dimensions": [], + "batch_size": 32 }, { "name": "fnlp/MOSS-TTSD-v0.5", diff --git a/conf/models/togetherai.json b/conf/models/togetherai.json index 690ec34c1d..e42c4945e5 100644 --- a/conf/models/togetherai.json +++ b/conf/models/togetherai.json @@ -51,21 +51,24 @@ "max_tokens": 514, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "BAAI/bge-large-en-v1.5", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "BAAI/bge-base-en-v1.5", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 2048 }, { "name": "mixedbread-ai/mxbai-rerank-large-v2", diff --git a/conf/models/upstage.json b/conf/models/upstage.json index ac2a5d223f..2162499780 100644 --- a/conf/models/upstage.json +++ b/conf/models/upstage.json @@ -59,14 +59,16 @@ "max_tokens": 2000, "model_types": [ "embedding" - ] + ], + "batch_size": 100 }, { "name": "solar-embedding-1-large-passage", "max_tokens": 2000, "model_types": [ "embedding" - ] + ], + "batch_size": 100 } ] } diff --git a/conf/models/volcengine.json b/conf/models/volcengine.json index 6da91e021b..49743b464c 100644 --- a/conf/models/volcengine.json +++ b/conf/models/volcengine.json @@ -32,7 +32,8 @@ "max_tokens": 131072, "model_types": [ "embedding" - ] + ], + "batch_size": 10 } ] } diff --git a/conf/models/voyage.json b/conf/models/voyage.json index 2873ff4539..fd4b29b1a3 100644 --- a/conf/models/voyage.json +++ b/conf/models/voyage.json @@ -14,63 +14,72 @@ "max_tokens": 32000, "model_types": [ "embedding" - ] + ], + "batch_size": 1000 }, { "name": "voyage-4", "max_tokens": 32000, "model_types": [ "embedding" - ] + ], + "batch_size": 1000 }, { "name": "voyage-4-lite", "max_tokens": 32000, "model_types": [ "embedding" - ] + ], + "batch_size": 1000 }, { "name": "voyage-3.5", "max_tokens": 327680, "model_types": [ "embedding" - ] + ], + "batch_size": 1000 }, { "name": "voyage-3.5-lite", "max_tokens": 1048576, "model_types": [ "embedding" - ] + ], + "batch_size": 1000 }, { "name": "voyage-3-large", "max_tokens": 122880, "model_types": [ "embedding" - ] + ], + "batch_size": 1000 }, { "name": "voyage-code-3", "max_tokens": 122880, "model_types": [ "embedding" - ] + ], + "batch_size": 1000 }, { "name": "voyage-law-2", "max_tokens": 122880, "model_types": [ "embedding" - ] + ], + "batch_size": 1000 }, { "name": "voyage-finance-2", "max_tokens": 122880, "model_types": [ "embedding" - ] + ], + "batch_size": 1000 }, { "name": "rerank-2.5", diff --git a/conf/models/zhipu-ai.json b/conf/models/zhipu-ai.json index c55522420e..4f92c6ec4e 100644 --- a/conf/models/zhipu-ai.json +++ b/conf/models/zhipu-ai.json @@ -356,14 +356,16 @@ "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 512 }, { "name": "embedding-3", "max_tokens": 512, "model_types": [ "embedding" - ] + ], + "batch_size": 512 }, { "name": "glm-asr-2512",