Модели API Бенчмарк Интерпретация
● Внутренний сервис компьютерного зрения · для команды

Модели анализа фото по API
для контроля качества снимков

Сегментация, детекция, глубина, OCR и VLM на нашем GPU-сервере. Один ключ — доступ ко всем моделям. Фото не хранятся: возвращаем маски, рамки, карты глубины, текст и метаданные.

📊
Бенчмарк моделей
скорость всех моделей на GPU- и CPU-сервере, 100 фото
🖼
Графическая интерпретация
что каждая модель «видит»: маски, рамки, глубина, текст

Доступ к API

для команды — один общий ключ
🔑
API-ключ лежит в планерекарточка с доступами. Тот же ключ работает и для CPU-сервера (cpu.mindq.ru).
POST /v1/segment — синхронно (файл + модель + params) POST /v1/jobs — очередь (async, вернёт job_id) GET /v1/models — каталог моделей GET /v1/me — баланс и лимит
# Запрос: multipart-форма (image, model, params-JSON) curl https://api.mindq.ru/v1/segment \ -H "Authorization: Bearer <ключ-из-планера>" \ -F "image=@photo.jpg" \ -F "model=mindq/sam3" \ -F 'params={"prompt":"dish of food","threshold":0.4}' # Ответ (JSON): { "request_id": "req_...", "model": "mindq/sam3", "result": { // зависит от модели "n_instances": 1, "instances": [{ "score":0.87, "box":[x,y,x,y], "mask_png_b64":"iVBOR..." }], "text": null, "extra": { "area_pct": 34.1 } }, "image": {"w":1024,"h":768}, "timing": {"queue_ms":3,"infer_ms":210,"total_ms":260}, "cost_units": 10 } # Лимит файла — 20 МБ. Ошибки: {"error":{"code":"...","message":"..."}}

Модели и вызов по API

поле model = id ниже · params — необязательны (по умолчанию — как в колонке)
Модель (model=…)ЗадачаЧто делает / что возвращает Параметры по умолчанию
mindq/sam3
SAM 3 — сегментация по тексту
10 units/запрос
segmentation facebook/sam3 (fp16, GPU). Маски концепта по текстовому промпту, полные инстансы со score. Самая точная сегментация проекта.
prompt: dish of food threshold: 0.4 max_side: 1024
mindq/yoloe
YOLOE — детекция+маски по текстовым классам
2 units/запрос
detection yoloe-11l-seg: текстовые классы как YOLO-World, но с масками. Быстрый (~50 мс на GPU). Рамки + маски + score. В photo_qc: ≤2 /infer на job (food ROI+content_type, category fan-out).
classes: plate,bowl,tray,cup,glass,mug,saucer,food container,packaging conf: 0.2
mindq/isnet
isnet — маска главного объекта
1 units/запрос
matting rembg isnet-general-use: салиентная маска главного объекта без промпта. Работает на CPU (ONNX), GPU не занимает.
model_name: isnet-general-use
mindq/birefnet
BiRefNet — салиентная сегментация (точнее isnet)
2 units/запрос
matting rembg birefnet-general: архитектура точнее isnet, лучше на прозрачных краях. Без промпта. Порог маски регулируется (mask_threshold 0..255).
rembg_model: birefnet-general mask_threshold: 128
mindq/birefnet-lite
BiRefNet-lite — то же, вдвое быстрее
1 units/запрос
matting Облегчённый BiRefNet: примерно те же маски, вдвое быстрее полного.
rembg_model: birefnet-general-lite mask_threshold: 128
mindq/fastsam
FastSAM-s — «сегментируй всё» (быстрый)
2 units/запрос
segmentation FastSAM (маленькая): все сегменты кадра. Сырьё для «сегмент ∩ еда = посуда».
weights: FastSAM-s.pt conf: 0.4 iou: 0.9 imgsz: 1024
mindq/fastsam-x
FastSAM-x — «сегментируй всё» (точнее, тяжелее)
4 units/запрос
segmentation FastSAM большая: те же сегменты, точнее и медленнее FastSAM-s.
weights: FastSAM-x.pt conf: 0.4 iou: 0.9 imgsz: 1024
mindq/florence2
Florence-2 — сегментация по тексту (+полигоны)
8 units/запрос
segmentation Florence-2-large: сегментация по текстовому выражению, отдаёт полигоны (сохраняются полностью). Одна из немногих обводит блюдо С посудой.
prompt: food dish
mindq/depth
Depth Anything V2 Small — карта глубины
2 units/запрос
depth Монокулярная глубина (Small, 25M). Возвращает карту глубины картинкой (светлее = ближе), не бинарную маску. Сырьё для 3D-света и проверки боке.
hf_model: depth-anything/Depth-Anything-V2-Small-hf
mindq/depth-large
Depth Anything V2 Large — глубина (точнее)
4 units/запрос
depth Большая версия (335M): заметно точнее края и дальние планы, чем Small.
hf_model: depth-anything/Depth-Anything-V2-Large-hf
mindq/qwen-vl
Qwen2.5-VL 3B — VLM (ответ текстом на вопрос о фото)
15 units/запрос
vlm Зрительно-языковая модель: задайте вопрос в params.prompt — «еда по центру?», «есть водяной знак?», «опиши блюдо». Ответ в result.text (масок не даёт).
hf_model: Qwen/Qwen2.5-VL-3B-Instruct max_new_tokens: 256
mindq/qwen-text
Qwen2.5-0.5B — быстрый text LLM (OCR → класс)
2 units/запрос
text Text-only Instruct. Картинка игнорируется. В params.text — OCR-фрагмент, модель выбирает класс (food_package / beverage_label / pharma…). Ответ в result.text и result.label.
hf_model: Qwen/Qwen2.5-0.5B-Instruct max_new_tokens: 24
mindq/qwen-text-1.5b
Qwen2.5-1.5B — text LLM (точнее / чуть медленнее)
3 units/запрос
text Тот же text-only пайплайн, модель 1.5B. Для сравнения latency/качества с 0.5B.
hf_model: Qwen/Qwen2.5-1.5B-Instruct max_new_tokens: 24
mindq/easyocr
EasyOCR (GPU) — текст на фото
3 units/запрос
ocr Поиск текста (упаковка, водяные знаки, вывески). Полные полигоны (4 точки) и уверенность каждого блока; весь текст — в result.text.
langs: ['en', 'ru'] min_conf: 0.3 upscale: 2.0
mindq/paddleocr
PaddleOCR — OCR этикеток (PP-OCR)
2 units/запрос
ocr Baidu PaddleOCR (angle cls + det + rec). Обычно чище EasyOCR на упаковках. Текст в result.text, блоки в extra.blocks.
min_conf: 0.3 max_side: 1280
mindq/got-ocr
GOT-OCR 2.0 — end-to-end OCR
4 units/запрос
ocr End-to-end OCR-VLM (~580M). Хорош на смешанном/кривом тексте этикеток. Ответ целиком в result.text.
hf_model: stepfun-ai/GOT-OCR-2.0-hf max_new_tokens: 512 max_side: 1024
mindq/florence2-ocr
Florence-2 — OCR mode
4 units/запрос
ocr Florence-2 large в режиме <OCR>. Тот же чекпоинт, что сегментация, отдельный model_id. Текст в result.text.
hf_model: florence-community/Florence-2-large task: <OCR> max_side: 1024 max_new_tokens: 1024

Что показывают тесты

две страницы для презентации результатов
📊
Бенчмарк
4 способа (GPU-API, GPU-локально, дома, CPU-сервер), время по каждому фото
🖼
Интерпретация
наложения масок/рамок/глубины и сравнение согласия моделей