Сейчас ваша корзина пуста!
Объектное обнаружение на основе подсказок с Gemini 2.0
Разблокируйте мощное обнаружение объектов на основе запросов для изображений с помощью функции ограничивающего прямоугольника Gemini 2.0 — идеально подходит для контекстного поиска, например, для выявления взрослых с детьми или автомобилей, припаркованных за пределами разрешенной зоны. Беспрепятственно загружайте изображения, извлекайте размеры и позволяйте Gemini 2.0 возвращать точные координаты ограничивающих прямоугольников для ваших выбранных объектов (например, кроликов). Автоматически изменяйте масштаб координат для точности изображения и визуализируйте результаты, рисуя ограничивающие прямоугольники прямо на изображениях. Идеально подходит для инновационных сценариев использования — от основанных на доказательствах рабочих процессов до поисков изображений нового поколения. Требует Google Gemini для LLM; в настоящее время является экспериментальной функцией,…
Описание
Этот рабочий процесс демонстрирует, как использовать экспериментальные возможности обнаружения объектов с помощью ограничивающих рамок на основе подсказок в Google Gemini 2.0 в автоматизации n8n. Основная задача — идентифицировать конкретные объекты или темы на изображении на основе естественной языковой подсказки (например, «все кролики»), извлечь их координаты ограничивающих рамок и визуально отметить эти обнаруженные объекты на оригинальном изображении.
Логический поток разделен на следующие основные блоки:
1.1 Получение входных данных и подготовка изображения
- Скачать тестовое изображение по URL
- Извлечь метаданные изображения (ширину и высоту), необходимые для масштабирования координат
1.2 Обработка с использованием Gemini 2.0
- Отправить изображение и подсказку в API Gemini 2.0 для обнаружения ограничивающих рамок
- Получить нормализованные координаты ограничивающих рамок в формате JSON
1.3 Масштабирование и обработка координат
- Разобрать и извлечь данные об ограничивающих рамках
- Преобразовать нормализованные координаты (масштаб от 0 до 1000) в реальные пиксельные значения на основе размеров изображения
1.4 Визуализация результатов
- Нарисовать ограничивающие рамки на оригинальном изображении, используя масштабирующие координаты
- Вывести аннотированное изображение для проверки или дальнейшего использования
Оригинал воркфлоу на сайте n8n.io
____________
Похожие товары
-
AI Chatbot Call Center: Входящий вызов в Telegram (Готово к производству, Часть 1а)
-
AI продажный агент: WhatsApp, FB, IG, OpenAI, Airtable, Supabase Авто-бронирование
-
AI Чат-бот Колл-центр: Демонстрационный Звонок (Готово к Продакшну, Часть 6)
-
AI Чат-бот Колл-центр: Общий поток исключений (Готов к производству, Часть 8)
-
AI Чат-бот Колл-центр: Поддержка бронирования такси (Готово к производству, Часть 7)







Отзывы
Отзывов пока нет.