Сегментация, детекция, глубина, OCR и VLM на нашем GPU-сервере. Один ключ — доступ ко всем моделям. Фото не хранятся: возвращаем маски, рамки, карты глубины, текст и метаданные.
model = id ниже · params — необязательны (по умолчанию — как в колонке)| Модель (model=…) | Задача | Что делает / что возвращает | Параметры по умолчанию |
|---|---|---|---|
| mindq/sam3 SAM 3 — сегментация по тексту
10 units/запрос |
segmentation | facebook/sam3 (fp16, GPU). Маски концепта по текстовому промпту, полные инстансы со score. Самая точная сегментация проекта. | prompt: dish of food
threshold: 0.4
max_side: 1024 |
| mindq/yoloe YOLOE — детекция+маски по текстовым классам
2 units/запрос |
detection | yoloe-11l-seg: текстовые классы как YOLO-World, но с масками. Быстрый (~50 мс на GPU). Рамки + маски + score. В photo_qc: ≤2 /infer на job (food ROI+content_type, category fan-out). | classes: plate,bowl,tray,cup,glass,mug,saucer,food container,packaging
conf: 0.2 |
| mindq/isnet isnet — маска главного объекта
1 units/запрос |
matting | rembg isnet-general-use: салиентная маска главного объекта без промпта. Работает на CPU (ONNX), GPU не занимает. | model_name: isnet-general-use |
| mindq/birefnet BiRefNet — салиентная сегментация (точнее isnet)
2 units/запрос |
matting | rembg birefnet-general: архитектура точнее isnet, лучше на прозрачных краях. Без промпта. Порог маски регулируется (mask_threshold 0..255). | rembg_model: birefnet-general
mask_threshold: 128 |
| mindq/birefnet-lite BiRefNet-lite — то же, вдвое быстрее
1 units/запрос |
matting | Облегчённый BiRefNet: примерно те же маски, вдвое быстрее полного. | rembg_model: birefnet-general-lite
mask_threshold: 128 |
| mindq/fastsam FastSAM-s — «сегментируй всё» (быстрый)
2 units/запрос |
segmentation | FastSAM (маленькая): все сегменты кадра. Сырьё для «сегмент ∩ еда = посуда». | weights: FastSAM-s.pt
conf: 0.4
iou: 0.9
imgsz: 1024 |
| mindq/fastsam-x FastSAM-x — «сегментируй всё» (точнее, тяжелее)
4 units/запрос |
segmentation | FastSAM большая: те же сегменты, точнее и медленнее FastSAM-s. | weights: FastSAM-x.pt
conf: 0.4
iou: 0.9
imgsz: 1024 |
| mindq/florence2 Florence-2 — сегментация по тексту (+полигоны)
8 units/запрос |
segmentation | Florence-2-large: сегментация по текстовому выражению, отдаёт полигоны (сохраняются полностью). Одна из немногих обводит блюдо С посудой. | prompt: food dish |
| mindq/depth Depth Anything V2 Small — карта глубины
2 units/запрос |
depth | Монокулярная глубина (Small, 25M). Возвращает карту глубины картинкой (светлее = ближе), не бинарную маску. Сырьё для 3D-света и проверки боке. | hf_model: depth-anything/Depth-Anything-V2-Small-hf |
| mindq/depth-large Depth Anything V2 Large — глубина (точнее)
4 units/запрос |
depth | Большая версия (335M): заметно точнее края и дальние планы, чем Small. | hf_model: depth-anything/Depth-Anything-V2-Large-hf |
| mindq/qwen-vl Qwen2.5-VL 3B — VLM (ответ текстом на вопрос о фото)
15 units/запрос |
vlm | Зрительно-языковая модель: задайте вопрос в params.prompt — «еда по центру?», «есть водяной знак?», «опиши блюдо». Ответ в result.text (масок не даёт). | hf_model: Qwen/Qwen2.5-VL-3B-Instruct
max_new_tokens: 256 |
| mindq/qwen-text Qwen2.5-0.5B — быстрый text LLM (OCR → класс)
2 units/запрос |
text | Text-only Instruct. Картинка игнорируется. В params.text — OCR-фрагмент, модель выбирает класс (food_package / beverage_label / pharma…). Ответ в result.text и result.label. | hf_model: Qwen/Qwen2.5-0.5B-Instruct
max_new_tokens: 24 |
| mindq/qwen-text-1.5b Qwen2.5-1.5B — text LLM (точнее / чуть медленнее)
3 units/запрос |
text | Тот же text-only пайплайн, модель 1.5B. Для сравнения latency/качества с 0.5B. | hf_model: Qwen/Qwen2.5-1.5B-Instruct
max_new_tokens: 24 |
| mindq/easyocr EasyOCR (GPU) — текст на фото
3 units/запрос |
ocr | Поиск текста (упаковка, водяные знаки, вывески). Полные полигоны (4 точки) и уверенность каждого блока; весь текст — в result.text. | langs: ['en', 'ru']
min_conf: 0.3
upscale: 2.0 |
| mindq/paddleocr PaddleOCR — OCR этикеток (PP-OCR)
2 units/запрос |
ocr | Baidu PaddleOCR (angle cls + det + rec). Обычно чище EasyOCR на упаковках. Текст в result.text, блоки в extra.blocks. | min_conf: 0.3
max_side: 1280 |
| mindq/got-ocr GOT-OCR 2.0 — end-to-end OCR
4 units/запрос |
ocr | End-to-end OCR-VLM (~580M). Хорош на смешанном/кривом тексте этикеток. Ответ целиком в result.text. | hf_model: stepfun-ai/GOT-OCR-2.0-hf
max_new_tokens: 512
max_side: 1024 |
| mindq/florence2-ocr Florence-2 — OCR mode
4 units/запрос |
ocr | Florence-2 large в режиме <OCR>. Тот же чекпоинт, что сегментация, отдельный model_id. Текст в result.text. | hf_model: florence-community/Florence-2-large
task: <OCR>
max_side: 1024
max_new_tokens: 1024 |