Ricercatori Apple propongono pensiero visivo internalizzato per ragionamento video proattivo
· By Antonio Sedino, CTRO · Published by Reinventy Solutions Corp.
Nuovo approccio oltre visual chain-of-thought generando rappresentazioni interne per ragionamento spaziale, temporale e incarnato.

I modelli multimodali di grandi lingue usano sempre più visual chain-of-thought (Visual CoT) per ragionare su ambienti spaziali, temporali e incarnati. Generando immagini di ragionamento intermedie, Visual CoT fornisce un meccanismo intuitivo per la visuale previsione ma introduce un overhead di inferenza sostanziale, che è partic...
Read the original source at Apple Machine Learning Research ↗
