Tsinghua KEG Lab и Zhipu AI совместно запустили CogAgent, большую модель понимания изображений

2023-12-28 08:27:29

Bit News: Tsinghua KEG Lab недавно сотрудничала с Zhipu AI, чтобы совместно запустить новое поколение CogAgent для понимания изображений больших моделей. Основанная на ранее запущенном CogVLM, модель использует визуальные модальности вместо текста, чтобы обеспечить более полное и непосредственное восприятие интерфейса GUI через визуальный агент GUI для планирования и принятия решений. Сообщается, что CogAgent может принимать ввод изображений высокого разрешения 1120×1120, с визуальным ответом на вопросы, визуальным позиционированием (Grounding), GUI Agent и другими возможностями, в 9 классических списках понимания изображений (включая VQAv2, STVQA, DocVQA, TextVQA, MM-VET, POPE и т.д.) достиг первого результата в общей способности.

VET-1.34%

Посмотреть Оригинал

На этой странице может содержаться сторонний контент, который предоставляется исключительно в информационных целях (не в качестве заявлений/гарантий) и не должен рассматриваться как поддержка взглядов компании Gate или как финансовый или профессиональный совет. Подробности смотрите в разделе «Отказ от ответственности» .

Награда
лайк
комментарий
Репост
Поделиться

комментарий

0/400

Нет комментариев

Тема
#Crypto Market Pullback
257k Популярность
#Jackson Hole Meeting
4k Популярность
#Gate Alpha ESPORTS Points Airdrop
3k Популярность
#Institutions Hold 10M+ ETH
22k Популярность
#MicroStrategy Loosens Stock Rules
17k Популярность

Закрепить

Карта сайта