Oltre Visual CoT: Pensiero Visivo Interno per il Ragionamento Video Proattivo
HERALD · Artificial Intelligence
I modelli linguistici multimodali di grandi dimensioni usano sempre più spesso la visual chain-of-thought (Visual CoT) per ragionare su ambienti spaziali, temporali e incarnati. Generando immagini di ragionamento intermedie, Visual CoT fornisce un meccanismo intuitivo per la visione prospettica ma introduce un notevole overhead di inferenza, particolarmente impegnativo per applicazioni in tempo reale. Ricerche sul visual thinking interno mirano a risolvere questo overhead mantenendo le capacità di ragionamento di Visual CoT per il ragionamento video proattivo.
Read the original source at Apple Machine Learning Research ↗
