Arm C1: Это новые ядра, которые повышают производительность и ИИ.

  • Новое семейство ядер Arm C1 (Ultra, Premium, Pro и Nano) с производительностью многоядерных процессоров до 45%.
  • SME2 ускоряет работу ИИ на ЦП: среднее улучшение в 3,7 раза и до 5 раз при определенных нагрузках при сниженном энергопотреблении.
  • C1-DSU позволяет создавать кластеры из 14 ядер, общего L3 и очень гибких конфигураций.
  • Платформа Lumex CSS: интеграция процессора C1, графического процессора Mali G1 и поддержка 6 нм LPDDR3.

Ядра Arm C1

Новая семья Ядра Arm C1 знаменует собой существенный сдвиг в экосистеме мобильных и ультрапортативных устройств, заменив привычный Cortex на более чёткий подход к стабильной производительности и эффективности. Это поколение оснащено Платформа Lumex и с очевидной целью: ускорить работу ИИ на самом устройстве без ущерба для батареи или температуры.

Помимо изменения названия, предложение объединяет Архитектура Armv9.3-A, глубокая переработка подсистемы памяти и значительное расширение возможностей матричных вычислений. Результатом стали масштабное повышение производительности при снижении энергопотребления, а также разработка плана развития для смартфонов, планшетов, ноутбуков и носимых устройств.

Архитектура и новые возможности ядер Arm C1

Архитектура ядра Arm C1

Серия C1 представлена ​​четырьмя вариантами: С1-Ультра (максимальная производительность), C1-Премиум (высокая производительность на меньшей площади), С1-Про (баланс) и C1-Нано (максимальная эффективность). Каждый производитель может объединять эти блоки в гетерогенные кластеры для создания систем на кристалле, адаптированных к различным диапазонам и сферам применения, с различными конфигурациями до 14 ядер.

Arm доработала как front-, так и back-end, включая улучшения в области прогнозирования, кэширования и внеочередного выполнения. Благодаря новому межсоединению и более эффективному (с большим объёмом данных) общему кэшу, SLC-клетки), платформа предлагает средний прирост около 15% при повседневном использовании, который масштабируется +30% на сложные грузы и достичь пиков до 45% в многоядерном режиме.

Поддержка памяти развивается вместе с LPDDR6 для снижения энергопотребления и задержки, сохраняя при этом совместимость с LPDDR5X на скорости до 9600 МТ/с. Эта база памяти, наряду с перепроектированным кластером, обеспечивает стабильную производительность и быстрый отклик в условиях термической нагрузки.

C1-Ultra: потолок производительности

Как ядро ​​высшего класса, С1-Ультра Он ориентирован на флагманские SoC и высоконагруженные задачи, такие как вычислительная фотография, масштабные модели искусственного интеллекта или мобильные игры класса AAA. По сравнению с Cortex-X925, Arm заявляет о +25% в один поток, показатель, который помогает масштабировать общую производительность в сочетании с большим количеством ядер в кластере.

Интерфейс улучшает пропускную способность L1 инструкций и точность прогнозирования, в то время как бэкэнд увеличивает окно внеочередного выполнения примерно на 25%, достигая примерно 2.000 инструкций Одновременно. Кроме того, объём данных L1 удваивается до 128 КБ, а скорость чтения L1 увеличивается примерно на 33%.

C1-Premium: высокая производительность на меньшей площади

Для устройств премиум-класса, которым не нужен абсолютный максимум, C1-Премиум поддерживает архитектуру, очень близкую к Ultra, но с Уменьшение площади на 35%Он разработан с целью обеспечения баланса производительности и стоимости, что позволяет создавать более компактные конструкции без ущерба для габаритов.

C1-Pro: баланс и многоядерные мышцы

В центральном сегменте, С1-Про заменяет Cortex‑A725 на +11% эффективности при том же потреблении и с повышением эффективности, которое достигает до 26% меньше энергии при той же производительностиВ игровой индустрии Arm сообщает о прибыли около + 16% в этом классе ядер.

Ключи находятся в более мощном интерфейсе (улучшенное статическое прогнозирование и Гораздо больше BTB), а также бэкенд с большей пропускной способностью в L1D и меньшей задержкой в ​​L2 при верном прогнозе. Предиктор также был настроен для ускорения отклика в реальных сценариях.

C1-Nano: эффективность превыше всего

Для легких задач и крайней экономии, C1-Нано увеличивает эффективность примерно на 26% по сравнению с предшественником (область практически не изменилась, ~+2% по сравнению с A520). Этапы прогнозирования и выборки разделены, чтобы быстрее передавать инструкции в L1 и сократить время ожидания ошибочных прогнозов.

Кроме того, векторная обработка, диски отключаются при зависании конвейера, а трафик между L3 и DRAM сокращается (в среднем около 21% и до 39% при определенных нагрузках), что снижает потребление и улучшает отклик.

C1-DSU: гибкие кластеры и меньшее потребление

Новые C1‑DSU Организует соединение ядер под общим кэшем третьего уровня и обеспечивает связь с остальной частью SoC (ОЗУ, графическим процессором и т.д.). По сравнению с предыдущими версиями, эта конструкция снижает типичное энергопотребление системы примерно на один 11% и влияние памяти на ~7%, опираясь на такие режимы, как L3 Быстрый сон для минимизации потерь при неиспользовании.

Другим ключевым элементом является интеграция Ускорители SME2 как элементы, внешние по отношению к ядру: в C1-Ultra и C1-Premium их наличие обязательно, а в C1-Pro и C1-Nano Это опционально в зависимости от конструкции производителя. Любое ядро ​​кластера может получить к ним доступ при наличии, что позволяет создавать самые разнообразные комбинации (например, 2× C1‑Ultra + 6× C1‑Pro с одним или двумя ускорителями SME2, ​​или более скромные комбинации, сочетающие Pro и Nano).

Платформа Lumex также включает новое поколение графических процессоров. Хотя основное внимание в этой новости уделяется центральным процессорам, Мали G1 сопровождалось улучшением графической производительности примерно на 20%, удваивает производительность трассировки лучей и снижает затраты энергии на каждый кадр примерно на 9%, улучшая сочетание игр, в первую очередь использующих GPU, и рабочих нагрузок ИИ.

SME2 и роль ЦП в ИИ

SME2 на Arm C1

Большой скачок в развитии искусственного интеллекта происходит с SME2 (Масштабируемое матричное расширение 2), который ускоряет умножение матриц, многопредикаты и новые типы данных (включая компактные точности, такие как 2b/4b), а также координируется с SVE2 для расширенной векторизации. В общих цифрах Арм говорит о среднее улучшение в 3,7 раза с падением потребления, близким к один 27%.

В практических случаях компания продемонстрировала сокращение задержек 4,7x в распознавании речи (Whisper Base), ускорение в 2,4–2,8 раза текст в речь и значительное увеличение генерации токенов для LLM (например, Gemma 3), которые близки к × 5Работа на центральном процессоре позволяет избежать передачи данных другим ускорителям, что сокращает время ожидания и обеспечивает быстроту реагирования.

При небольших или интерактивных нагрузках центральный процессор снова выходит на первый план: с МСБ2Многие повседневные задачи (локальное улучшение изображений, сегментация, классификация, эффекты камеры или аудио) выполняются быстрее, с меньшими накладными расходами и без использования сети. При увеличении нагрузки графический процессор или внешний нейропроцессор могут продолжать брать на себя основную нагрузку, но центральный процессор больше не является узким местом.

Также доступна поддержка программного обеспечения: есть интеграция в Linux и Android 16, оптимизированные цепочки инструментов и библиотеки (KleidiAI), а также совместимость с такими движками, как Unity и Unreal EngineЭто позволит приложениям и играм быстрее внедрять эти усовершенствования, как только появятся первые коммерческие SoC.

платформа Lumex CSS объединяет все компоненты (процессор C1, графический процессор Mali G1, межсоединения и память) в готовые к производству конструкции 3 нм, аппаратная телеметрия и Совместимость с системой Arm с LPDDR6. Это позволяет партнёрам ускорить свои мобильные и портативные проекты благодаря масштабируемым кластерам с числом ядер до 14 и функциям искусственного интеллекта на устройствах.

Arm C1 сочетает в себе устойчивая производительность, эффективность и реальный толчок для ИИ на ЦП благодаря SME2; они предлагают гибкость C1-DSU для адаптации кластеров к каждой линейке продуктов и составляют прочную основу для следующей волны мобильных и портативных SoC, которые стремятся сбалансировать мощность, автономность и возможности ИИ без постоянной зависимости от облака.

SoC RISC-V Sophgo
Теме статьи:
SOPHGO SG2000/SG2002: SoC для искусственного интеллекта с ядром RISC-V + ARM

Добавить в качестве предпочтительного источника