Bienvenue client !
smart-city-siteNouvelles de l'industrieWaic 2026 Live Highlights | hikvision lance une caméra intelligente multimodale
La Ville intelligenteColonne de marque Web】 « si quelqu’un nage dans le réservoir, avertissez - le à temps. » dans le passé, il s’agissait d’une directive donnée aux administrateurs de sécurité, tandis que lors du Congrès mondial sur l’intelligence artificielle 2026 (waic 2026), hikvision a montré une toute nouvelle possibilité: confier cette tâche directement à une caméra.
Le 17 juillet, le premier jour de l'ouverture de waic 2026, hikvision a lancé une caméra intelligente multimodale, réalisant "une seule phrase peut faire fonctionner la caméra". Par exemple, dans le scénario de gestion de la sécurité du réservoir, les caméras traditionnelles voient qu'il y a des « personnes» et des « eaux», tandis que les caméras intelligentes multimodales avec de bonnes tâches sont capables de surveiller non seulement les zones à risque en temps réel, de décrire avec précision les personnes, l'état et l'environnement dans la scène, de mieux comprendre la scène, de juger qu'il y a un risque de noyade dans la natation du personnel, d'alerter avec un avertisseur à couplage actif. Cette capacité à « comprendre, comprendre, exécuter » marque l’évolution de la caméra vers un « Assistant Intelligent » de service actif.
Cette percée a bénéficié de la fusion profonde des grands modèles multimodaux avec l'architecture Edge Computing. « Nous avons installé le grand modèle multimodal dans ce petit boîtier, ce qui lui permet non seulement de percevoir avec précision, mais également de reconnaître, juger et répondre rapidement, de s'adapter à des scénarios tels que les alertes de proximité de l'eau pour ce qui est de la sécurité et des exigences élevées en temps réel. » par rapport aux caméras traditionnelles, les caméras intelligentes multimodales ont une meilleure compréhension de la scène, une configuration plus flexible des tâches et une capacité de traitement des bords plus en temps réel.
Plus précisément, les caméras traditionnelles ne peuvent voir que ce qui est dans l'image, et les caméras dotées d'un grand modèle à vision unique peuvent comprendre ce qui est dans l'image, mais ne peuvent pas répondre aux instructions du langage humain. Et la caméra intelligente multimodale, grâce à la capacité multimodale, a réalisé un triple saut: l'un est la mise à niveau interactive, de l'écriture de règles complexes à la formulation directe des besoins; Deuxièmement, la compréhension de l'escalade, de l'identification "il y a un groupe de personnes" à la compréhension "ils nagent, il y a un risque"; Troisièmement, la mise à niveau de la décision, de l'alarme passive à la liaison active son et lumière, contrôle des notifications.
Sur le calcul des forces et des paramètres, la caméra intelligente multimodale intègre le calcul de la force 26t, le grand modèle multimodal paramétrique 2B intégré, prend en charge la compréhension de la profondeur du texte et la résolution sémantique, du côté de l'extrémité peut réaliser une boucle fermée d'interaction multimodale, qui peut être largement utilisée dans La sécurité publique, la gouvernance urbaine, la fabrication industrielle, la production sécurisée et d'autres domaines.
Il convient de mentionner que la caméra intelligente multimodale prend en charge le câblage en langage naturel, ce qui peut améliorer efficacement l'efficacité de l'entreprise. Dans l'exemple de l'application dans le scénario de production de sécurité, l'utilisateur doit simplement entrer un morceau de langage naturel, tel que « personne entrant dans la zone de construction sans vêtements réfléchissants s'il vous plaît alarmer», le système le transforme immédiatement en règles de commande dynamique, le flux vidéo en direct côté extrémité une fois qu'il correspond à la cible, déclenche immédiatement l'alarme et prend en charge le son et la lumière, le contrôle d'accès et d'autres périphériques. De la récupération passive à la défense active, s'engager dans la vérification postérieure à l'intervention dans les choses, réaliser la gestion en boucle fermée.
Dans la zone d'exposition waic 2026 hikvision, les visiteurs pourront également découvrir par eux - mêmes cette intelligence « à portée de main». En cliquant sur une entrée à l'écran, telle que « Quelle est cette scène, Analysez les comportements à risque dans la scène» ou « détectez si quelqu'un nage dans l'image, le cas échéant, avertissez», la caméra intelligente multimodale peut analyser automatiquement le contenu vidéo et générer des résultats de questions - réponses, des messages d'alerte en temps réel sur l'écran, ainsi qu'une alerte vocale indiquant « Il est interdit de nager ici, veuillez partir dès que possible».
Cette présentation montre non seulement intuitivement la puissance de hikvision dans la compréhension des textes et l'interaction avec le langage naturel, mais permet également aux téléspectateurs en direct de ressentir que le grand modèle n'est pas seulement "capable de lire", mais plus "capable de parler" et "capable de travailler", est un assistant intelligent qui peut vraiment s'enraciner dans la scène de première ligne.
Des rappels de proximité des réservoirs à la production sûre des usines, de la gouvernance urbaine à la vente au détail intelligente… dans le passé, de nombreux scénarios analytiques intelligents étaient limités par la bande passante du réseau ou les coûts de calcul dans le cloud, ce qui rendait difficile la réponse en temps réel. Hikvision, grâce à son accumulation profonde dans le domaine de l'Ido, continue de promouvoir la technologie de l'IA à la périphérie, et aujourd'hui, le lancement de la caméra intelligente multimodale, marque la capacité de l'IA à vraiment plonger dans le dernier kilomètre de l'application de l'industrie, qui injectera une nouvelle énergie dynamique pour la transformation numérique de milliers de centaines de millions d'industries.
Dernières nouvelles