Grin logo
de en es fr
Boutique
GRIN Website
Publier des textes, profitez du service complet
Aller à la page d’accueil de la boutique › Informatique - Intelligence artificielle

Multimodal Framework for Video Summarization Using Transformers and Deep Learning

Integrating Visual, Audio, and Textual Data

Titre: Multimodal Framework for Video Summarization Using Transformers and Deep Learning

Travail de Recherche , 2026 , 58 Pages

Autor:in: Suryakanthi Tangirala (Auteur), Jinaga Neeraja (Auteur)

Informatique - Intelligence artificielle
Extrait & Résumé des informations   Lire l'ebook
Résumé Résumé des informations

This text aims to develop a multimodal deep learning framework for automatically generating concise and meaningful summaries of lengthy video content. The proposed approach combines visual, audio, and textual information to identify relevant video segments while preserving essential context and reducing redundancy.

The framework integrates pretrained models such as Vision Transformers (ViT) for visual feature extraction, Whisper for speech recognition, and BART or DistilBERT for textual and contextual processing. Transformer-based architectures combine these representations to assess segment relevance and generate coherent summaries. The approach can support applications in education, entertainment, surveillance, news analysis, sports, and multimedia information retrieval.

Résumé des informations

Titre
Multimodal Framework for Video Summarization Using Transformers and Deep Learning
Sous-titre
Integrating Visual, Audio, and Textual Data
Auteurs
Suryakanthi Tangirala (Auteur), Jinaga Neeraja (Auteur)
Année de publication
2026
Pages
58
N° de catalogue
V1759421
ISBN (PDF)
9783389206256
ISBN (Livre)
9783389206263
Langue
anglais
mots-clé
Multimodal Video Summarization Deep Learning Transformers Vision Transformer Automatic Speech Recognition
Sécurité des produits
GRIN Publishing GmbH
Citation du texte
Suryakanthi Tangirala (Auteur), Jinaga Neeraja (Auteur), 2026, Multimodal Framework for Video Summarization Using Transformers and Deep Learning, Munich, GRIN Verlag, https://www.grin.com/document/1759421
Lire l'ebook
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
  • Si vous voyez ce message, l'image n'a pas pu être chargée et affichée.
Extrait de  58  pages
Grin logo
  • Grin.com
  • Expédition
  • Contact
  • Prot. des données
  • CGV
  • Imprint
  • Révoquer le contrat