Reinventy Solutions Corp. · Technology intelligencePrivate control
ReinventyHERALD
Evidence-led daily edition
LanguageEN · IT · FR
← Front pageArtificial Intelligence

Au-delà de Visual CoT : Pensée visuelle internalisée pour la raison vidéo proactive

Les grands modèles de langage multimodaux utilisent de plus en plus la chaîne de pensée visuelle (Visual CoT) pour raisonner sur des environnements spatiaux, temporels et incarnés. En générant des images de raisonnement intermédiaires, Visual CoT offre un mécanisme intuitif pour la vision par avance, mais introduit une surcharge d'inférence substantielle, ce qui est particulièrement difficile pour les applications en temps réel. Des recherches sur la pensée visuelle internalisée visent à résoudre cette surcharge tout en maintenant les capacités de raisonnement de Visual CoT pour la raison vidéo proactive.

Read the original source at Apple Machine Learning Research ↗