Please enable JavaScript.
Coggle requires JavaScript to display documents.
Antecipação de Ações e Interações Futuras, Deteção e Previsão de…
Antecipação de Ações e Interações Futuras
EGO4D Forecasting
: Utiliza "Future Hand Prediction" para prever os movimentos das mãos em vídeos egocêntricos.
PALM:
Aproveita modelos de visão-linguagem (VLMs) para prever ações futuras com base em contexto visual e textual.
MECCANO
: Implementa RULSTM para a antecipação de ações em vídeos egocêntricos.
Diff-IP2D
e
MADiff:
Preveem estados futuros de interação mão-objeto (HOI) em vídeos egocêntricos. Alguns modelos incorporam:
Consciência de movimento para capturar a influência do movimento da câmara na previsão da trajetória da mão.○
Modelos de fundação, como GLIP, para capturar a semântica de alto nível das imagens.
Mecanismos de atenção para lidar com regiões ocluídas.
Fusão multimodal para integrar diferentes modalidades, como RGB, fluxo ótico e egomoção.
Deteção e Previsão de Interações com Objetos
TransFusion:
Emprega fusão multimodal para integrar características visuais e linguísticas, antecipando interações de objetos usando um modelo de fusão orientado para o lado.
MECCANO:
Usa Faster R-CNN para a deteção de objetos ativos e previsão de objetos futuros
Diff-IP2D:
Utiliza um modelo de difusão para prever estados futuros de interação mão-objeto em vídeos egocêntricos, utilizando difusão de ruído no espaço latente.
Object-Centric Transformer (OCT)
: Captura as relações mão-objeto a partir de vídeos para prever a trajetória da mão e os pontos de contacto futuros nos objetos (hotspots de interação).
Reconhecimento e Deteção em Ambientes Industriais
IndustReal
Procedural Step Recognition (PSR)
para identificar a conclusão correta e a ordem dos passos processuais.
Assembly State Detection (ASD)
usando YOLOv8-m para detetar estados de montagem.
MECCANO
: Utiliza o modelo SlowFast para melhorar o reconhecimento de ações em ambientes industriais complexos.
Avaliação e Reconhecimento em Perspectiva Egocêntrica
EgoThink:
Utiliza modelos como o GPT-4V para avaliar a capacidade de "pensar" em primeira pessoa, respondendo a perguntas sobre imagens egocêntricas.
PALM
: Inclui um módulo de reconhecimento de ação para gerar etiquetas de ações passadas e realizar previsões futuras.