Au-delà de Visual CoT : Pensée visuelle internalisée pour la raison vidéo proactive
HERALD · Artificial Intelligence
Les grands modèles de langage multimodaux utilisent de plus en plus la chaîne de pensée visuelle (Visual CoT) pour raisonner sur des environnements spatiaux, temporels et incarnés. En générant des images de raisonnement intermédiaires, Visual CoT offre un mécanisme intuitif pour la vision par avance, mais introduit une surcharge d'inférence substantielle, ce qui est particulièrement difficile pour les applications en temps réel. Des recherches sur la pensée visuelle internalisée visent à résoudre cette surcharge tout en maintenant les capacités de raisonnement de Visual CoT pour la raison vidéo proactive.
Read the original source at Apple Machine Learning Research ↗
