Les chercheurs d'Apple proposent une pensée visuelle internalisée pour un raisonnement vidéo proactif
· By Antonio Sedino, CTRO · Published by Reinventy Solutions Corp.
Recherche Apple Machine Learning introduit une méthode au-delà de la chaîne de pensée visuelle, permettant aux modèles d'intérioriser la pensée visuelle pour un raisonnement vidéo proactif sans générer d'images de raisonnement intermédiaires.

Les modèles de langage multimodaux utilisent de plus en plus la chaîne de pensée visuelle (Visual CoT) pour raisonner sur des environnements spatiaux, temporels et incarnés. En générant des images de raisonnement intermédiaires, Visual CoT offre un mécanisme intuitif pour la vision avant mais introduit une charge d'inférence substantielle, qui est partic...
Read the original source at Apple Machine Learning Research ↗
