Member
Статус: Не в сети Регистрация: 12.02.2005 Откуда: Finland Фото: 13
Industrialice писал(а):
Я думаю
что чукча писатель. ЕСЧО РАЗ из книги по эльбрусу(приводил ранее)
Цитата:
В качестве особого проектного направления Комиссия по модернизации и технологическому развитию при Президенте Российской Федерации определила создание суперкомпьютеров для обеспечения основных разработок российской промышленности высокопроизводительными системами моделирования. Возможны и другие направления — очевидные и гипотетические. Важно, чтобы в нашей стране развитие информационных технологий неизменно опиралось на широкое использование отечественных микропроцессоров и вычислительных средств на их основе.
и
Цитата:
Эльбрус-4С — российский высокопроизводительный 64-разрядный универсальный микропроцессор производства компании МЦСТ при участии ИНЭУМ.
Industrialice писал(а):
средняя видеокарта разделает
Эльбрус, Интелл и АМД вместе взятых. так о чем это Вы?
Industrialice писал(а):
единственное чего определённо удалось добиться
независимости от запада в процах. с востоком договорица много легче и отношения с ними почти союзничесские.
Industrialice писал(а):
инфы по нему всё равно почти что нету
спасибо КЭП,
_________________ (\__/) (='.'=) This is Bunny. Copy and paste bunny into your signature to help him Gain world domination!! Хватит ВЫкать, я молодой 8)
Member
Статус: Не в сети Регистрация: 20.04.2012 Фото: 15
Industrialice писал(а):
Я думаю я могу это сказать другими словами: где нужна чистая вычислительная мощность, средняя видеокарта разделает Эльбрус; где нужно решать типичные для ЦП задачи, средний ЦП разделает Эльбрус
и другим... этот проц предназначен для оборонки, а для того что он догнал цп и гпу других производителей нужно вкладывать трилионы в развитие электроники, а трындеть на форумах типа эльбрус сливает и не хрен в него вкладывать это удел слабых.
Member
Статус: Не в сети Регистрация: 12.09.2010 Откуда: Калининград
Allu_n22 писал(а):
ЕСЧО РАЗ из книги по эльбрусу(приводил ранее)
Я этого не видел. И книга не нагуглилась. Вот в ней я смотрю действительно много инфы
Allu_n22 писал(а):
Эльбрус, Интелл и АМД вместе взятых. так о чем это Вы?
О том что средние ЦП Интел и АМД разделают любую самую крутую видеокарту с несколькими терафлопс на общих для ЦП задачах. Средняя видеокарта разделает мощнейшие ЦП Интел и АМД на задачах где нужна чистая мощь. Тут есть чёткое разделение. А Эльбрус в каком лагере? Такие вопросы точно бессмысленны теперь без знакомства с книгой, там должны быть какие-то ответы
Member
Статус: Не в сети Регистрация: 12.02.2005 Откуда: Finland Фото: 13
Industrialice писал(а):
А Эльбрус в каком лагере?
Allu_n22 писал(а):
ЕСЧО РАЗ 2
Allu_n22 писал(а):
для обеспечения основных разработок российской промышленности высокопроизводительными системами моделирования. Возможны и другие направления — очевидные и гипотетические.
Allu_n22 писал(а):
независимости от запада в процах.
чукча писатель
_________________ (\__/) (='.'=) This is Bunny. Copy and paste bunny into your signature to help him Gain world domination!! Хватит ВЫкать, я молодой 8)
Member
Статус: Не в сети Регистрация: 12.09.2010 Откуда: Калининград
Allu_n22, зря я писал про чёткое разделение между ЦП и видеокартами, это вы проигнорировали. Вы меня не поняли, ok, на этом можно закрыть вопрос, который всё равно был риторическим
Member
Статус: Не в сети Регистрация: 27.04.2003 Откуда: Москва Фото: 6
Industrialice писал(а):
Эльбрус в каком лагере?
Судя по всему, его пытаются делать достаточно универсальным и для числомолотильных задач, причём ориентируясь не столько на производительность одного чипа, сколько на масштабируемость, и для установки в персоналки военным и госслужащим.
Industrialice писал(а):
Средняя видеокарта разделает мощнейшие ЦП Интел и АМД на задачах где нужна чистая мощь.
Задач, где используется одна только арифметика, небольшой процент. В память ходить надо и условные переходы делать, а это уже легко просаживает производительность, если нет того хозяйства - кэшей, скорбординга и прочего - которое есть в ЦП. Кроме того, мало какие задачи легко и эффективно распараллеливаются на тысячи тредов.
об этом ответ уже давал. иль вы неудобное не видите?
Да берут китайские на ура. Те, кому нужно воевать, а не на стену вешать.
Allu_n22 писал(а):
а мы уже процы с будущим ультра топом из видюх сравниваем?
Они и GM204 на пару порядков сливают. Обычной tesla за смешные несколько килобаксов (по сравнению с эльбрусом - это смешные деньги же за производительность в десятки раз выше).
Allu_n22 писал(а):
они в этом году планируют с хасвеллом сравняца по флопсам
И чо? Повторяюсь - никого не интересует голая синтетика и узкий круг задач - в которых VLIW сливает по полной DSP, которые тоже штампуют массово, но которые никто в здравом уме не использует как ЦП (хотя они вполне могут так работать - тот же blackfin вполне линукс тянет). Потому как рабочая станция с теслой/файрпро даст в несколько десятков раз больше гигафлопсов, чем этот эльбрус, и обойдется в 10 раз дешевле как минимум. Да-да, или шкаф с сотней эльбрусов, или обычный atx комп с той же производительностью - что купят те, кому не важен язык маркировки чипа? А если еще учесть, что в эльбрусах-8с вероятность наличия той самой мифической закладки в разы выше, чем в зионе (ибо первые выпускаются на заграничном оборудовании заведомо для военки, а вторые - штампуются для всех и не должны внезапно отказывать)?
Allu_n22 писал(а):
очень много где. а ты всё со стороны домашнего юзера и рыночной конкуренции. не боряца они ни с Интелл ни с АМД.
Повторяюсь еще раз - в реальных задачах, которые считаются на CPU, а не на DSP/GPGPU, VLIW сливает по полной. И эльбрус-8с в архвировании, компиляции и т.п. generic задачах едва ли догонит какой-то чахлый i3. Даже если задаа параллелится на 8 потоков. Если задача не параллелится - производительность у одного его ядра будет где-то как у пентиума 3 15-летней давности.
Allu_n22 писал(а):
это был намёк на распил/откаты в этих сделках. до тебя опять не то дошло...
Какой распил-откаты? 3k$ за топовый серверный проц - это вполне нормальная цена. Если проц с военной приемкой - это вообще смешная цена. А вот 100 тыр за компьютер с производительностью пентиума 4 - это распил и откаты.
Allu_n22 писал(а):
угу может ссылочку на твой первоисточник даш? поглядим на альт. реальность.
Пока что единственное чего определённо удалось добиться этим ЦП - кучи бессмысленных споров на форумах среди людей которые в лучшем случае минимально разбираются в сабже - инфы по нему всё равно почти что нету для желающих узнать что это такое
Инфа есть, но характеристики не особо явно публикуют. Как и полагается люобй вундервафле - основная задача вселять гордость в сердца населения. Остальное - второстепенно.
Кстати, весьма странно, что в военке применяется BGA - у него же на порядок меньше надежность по сравнению с TQFP/DIP - т.е. отказов в 10 раз будет больше по сравнению с DIP/TQFP. Не осилили изготовление подложек с приваренными или припаянными высокотемпературным припоем DIP выводами (ну что-то наподобие амд процов, только лапы не оловом паять)?
DigiMakc писал(а):
Для числодробилки лучше подходит R9 290X.
А точнее - ее firepro собрат. Да в принципе какая разница, в 70 раз производительнее видеокарта будет, или в 100
NONsens писал(а):
Судя по всему, его пытаются делать достаточно универсальным и для числомолотильных задач, причём ориентируясь не столько на производительность одного чипа, сколько на масштабируемость, и для установки в персоналки военным и госслужащим.
Нет, его делают так, как могут Ведь куда проще налепить одинаковых исполнительных блоков, хоть их средняя утилизация в реальных задачах едва ли перевалит за 10%, чем делать предсказание ветвлений, внеочередное исполнение и т.п.
NONsens писал(а):
Задач, где используется одна только арифметика, небольшой процент. В память ходить надо и условные переходы делать, а это уже легко просаживает производительность, если нет того хозяйства - кэшей, скорбординга и прочего - которое есть в ЦП
В эльбрусе есть только кеши. Никакого предсказания переходов, никакого внеочередного исполнения... Основная фишка VLIW - исполнение большого кол-ва (в случае эльбруса - 23) (микро)команд за такт. Но - это нужно только там, где обработка данных независимая. Ну, к примеру, суммирование двух векторов, или прочее, что прекрасно будет считаться на GPU. А вот расчет того же CRC - для VLIW уже грусть-печаль...
NONsens писал(а):
Кроме того, мало какие задачи легко и эффективно распараллеливаются на тысячи тредов.
А еще меньше задач легко и эффективно разделяются на мноество независимых друг от друга микроопераций... А те, которые разделяются - те и на потоки нарезаются на ура
Так как в сегменте десктопов правит виндовс... Как бы не обсирали мастдай он попрежнему на 99% домашних компов установлен Одно только это надолго закрывает дорогу эльбрусам на домашние ПК
Я о десктопе не говорил. МЦСТ метит в серверы и может суперкомпьютеры. Хотя линуксоиды могли бы купить если цена была бы адекватной и для госучреждений тоже можно, для всякой бюрократии. Хотя для этих целей реально нужен четырёхядерник на высокой частоте, но пока его в планах нет.
DigiMakc писал(а):
Она не залочена на 30 фпс. В самой игре. в настройках можно выбрать 60 или 120.
Да, я тоже так думал и видел что возможность выбрать есть, но потом посмотрел видео внимательно и по всем признакам она залочена, частота зависает на 30. Но не суть, всё равно это ничего не меняет. Я уже написал что это просто чудо, ужасное, но чудо.
NiTr0 писал(а):
Да, камень для нищих, ценой 200 баксов. Затычка для сокета. Такие всегда были и будут.
Дело не в цене. Интересен этот проц другим. А точнее его старший брат E5-2650L - 12 ядерник. Это энергоэффективный проц с литерой L. Эти процы дают наибольшую эффективность на ватт. И за ними будущее. Скажем Intel® Xeon® Processor E5-1630 v3 (10M Cache, 3.70 GHz) 4 ядра , в три раза(300%) менее энергоэффективен на ватт, чем E5-2650L. Оценки проведены с учётом что все ядра одинаковы, а разница только в частоте.
NiTr0 писал(а):
E5-2687W v3, E5-2637 v3, E5-1630 v3 - последний 3.7 ггц, 4 фдра, первый - 3.1 ггц,
Ещё раз повторяю.
Цитата:
Так вот, все топовые процы имеют частоту от 2 Ггц до 2.6 Ггц.
Топовые по производительности. Тепловыделение десятиядерного Intel® Xeon® Processor E5-2687W v3 (25M Cache, 3.10 GHz) - 160 ватт. Это печка. Это хороший пример тупика. Тепловыделение восемнадцатиядерного Intel® Xeon® Processor E5-2699 v3 (45M Cache, 2.30 GHz) - 145 ватт. Производительность его выше на 25% и на 25% выше энергоэффективность на ватт и энергопотребление ниже на 10%. E5-2687W шестой по производительности в топе. У первых пяти частота 2.3-2.6 Ггц.
А теперь собственно итог. Для повышения производительности на один проц интел придётся переходить на энергоэффективные техпроцессы(а значит снижать частоту ниже 2 Ггц). Тепловыделение не позволяет больше втыкать новые ядра на этих частотах. Даже переход на новый техпроцесс 14 нм не поможет, как не помог он десктопным четырёхядерникам. Меньше площадь кристалла - хуже тепловоотвод. Круг замкнулся.
Для МЦСТ и Эльбрус это означает что частота их многоядерных процев может догнать частоту многоядерных интеловских. В ближайшие 4 года у МЦСТ запланирован выход 16 и 32 ядерных Эльбрусов.
Ведь куда проще налепить одинаковых исполнительных блоков, хоть их средняя утилизация в реальных задачах едва ли перевалит за 10%
Дальше ты пишешь про внеочередное исполнение, вот это и есть "налепить одинаковых исполнительных блоков".
NiTr0 писал(а):
предсказание ветвлений
В Эльбрусе применяют другие методики. Спекулятивное выполнение, подготовка передачи управления, предикатный режим выполнения команд. Так же имеется предварительная подкачка массивов и выполнение циклов методом программного конвейера.
NiTr0 писал(а):
внеочередное исполнение
В суперскалярах (RISC/CISC) этим занимается аппаратура, прямо во время выполнения программы, помногу раз одни и те же участки, отсюда и их аппетиты. В Эльбрусе этим занимается компилятор, один раз. Отсюда появляется приятный бонус, компилятор не ограничен по времени.
NiTr0 писал(а):
(в случае эльбруса - 23) (микро)команд за такт
Не микро. Микрооперации в x86 = операции в Эльбрусе. 1 упакованная команда до 23 операций. К примеру 1 команда x86 = 5 микрооперациям.
Код:
addl 8(%esi, %edi, 4), %eax
Такты: 0: Адрес = 8 + %esi + %edi * 4; 1: Загрузить значение по этому адресу; ?: Как число будет получено из памяти, сложить его с %eax и положить результат в %eax. Разница в том, что Haswell выполняет 8 параллельных микроопераций, а Эльбрус 23 параллельные операции.
NiTr0 писал(а):
А еще меньше задач легко и эффективно разделяются на мноество независимых друг от друга микроопераций... А те, которые разделяются - те и на потоки нарезаются на ура
Там где можно выполнять до 8 операций, разница будет зависеть только от наличия необходимого кол-ва нужных исполнительных блоков (хотя у Эльбруса тут преимущество, так как их больше), от рабочих частот и остальных подсистем (кеш, память и тд). Но там где можно выполнять больше 8 операций, Эльбрус будет быстрее.
Member
Статус: Не в сети Регистрация: 27.04.2003 Откуда: Москва Фото: 6
NiTr0 писал(а):
те, которые разделяются - те и на потоки нарезаются на ура
Вовсе необязательно. Для эффективности VLIW, равно как и суперскалярности, надо чтобы большинство команд не имели зависимости по данным с несколькими - соразмерно ширине VLIW - соседними, что довольно часто, а для эффективности мультитрединга нужна независимость между достаточно длинными цепочками как минимум из десятков команд, а скорее больше, в зависимости от латентности общих кэшей, довольно большой у GPU.
Дело не в цене. Интересен этот проц другим. А точнее его старший брат E5-2650L - 12 ядерник. Это энергоэффективный проц с литерой L. Эти процы дают наибольшую эффективность на ватт. И за ними будущее.
С чего такие выводы?
stockclock писал(а):
Топовые по производительности.
Производительность на ядро выше у первого. В задачах, которые похо параллелятся, он будет быстрее.
stockclock писал(а):
А теперь собственно итог. Для повышения производительности на один проц интел придётся переходить на энергоэффективные техпроцессы(а значит снижать частоту ниже 2 Ггц).
Бред. Выше приведенные камни - как обычные так и энергоэффективные - сделаны на одном и том же техпроцессе. Отличаются лишь напряжением и частотами.
mogler писал(а):
Дальше ты пишешь про внеочередное исполнение, вот это и есть "налепить одинаковых исполнительных блоков".
Нет. Налепить блоки - только часть задачи. А вот загрузить их - вторая часть. Если не делать планировщик команд, а тупо выгребать поток микроопераций из памяти - получим тупой как валенок VLIW, с ограничением по частоте ввиду сложности создания проводников равной длины от кешей/регистров к исполнительным блокам
mogler писал(а):
В Эльбрусе применяют другие методики. Спекулятивное выполнение, подготовка передачи управления, предикатный режим выполнения команд. Так же имеется предварительная подкачка массивов и выполнение циклов методом программного конвейера.
Спекулятивное выполнение было и в пентиуме 4, и сейчас осталось вроде как. Предвыборка в кеш - небольшое достижение.
mogler писал(а):
В суперскалярах (RISC/CISC) этим занимается аппаратура, прямо во время выполнения программы, помногу раз одни и те же участки, отсюда и их аппетиты. В Эльбрусе этим занимается компилятор, один раз. Отсюда появляется приятный бонус, компилятор не ограничен по времени.
Хорошо, покажите производительность в вычислении CRC на VLIW. на CISC - внеочередное исполнение с предсказанием переходов делает свое дело, все блоки неплохо утилизироаны. На эльбрусе - все будет очень печально. Даже если цикл при компиляции развернуть.
mogler писал(а):
Не микро. Микрооперации в x86 = операции в Эльбрусе. 1 упакованная команда до 23 операций. К примеру 1 команда x86 = 5 микрооперациям.
Ну я же и говорю - (микро)операции. Чтобы не путали с х86 командами. Сколько тактов займет скажем 1 итерация цикла
Код:
for (i=1; i<n; i++) array[i]+=array[i-1]*i;
на х86 (с внеочередным исполнением и т.п.) и vliw?
mogler писал(а):
Там где можно выполнять до 8 операций, разница будет зависеть только от наличия необходимого кол-ва нужных исполнительных блоков (хотя у Эльбруса тут преимущество, так как их больше), от рабочих частот и остальных подсистем (кеш, память и тд). Но там где можно выполнять больше 8 операций, Эльбрус будет быстрее.
Нет. Там, где много условных переходов - эльбрус сольется. Ну ессно разве что компилятор циклы развернет, и вместо 1 кб получится пару мегабайт кода
NONsens писал(а):
Для эффективности VLIW, равно как и суперскалярности, надо чтобы большинство команд не имели зависимости по данным с несколькими - соразмерно ширине VLIW - соседними, что довольно часто, а для эффективности мультитрединга нужна независимость между достаточно длинными цепочками как минимум из десятков команд, а скорее больше, в зависимости от латентности общих кэшей, довольно большой у GPU.
Ширина VLIW таки тоже десятки команд И да, CISC, как я уже говорил, может запустить на исполнение команды до того как произошел условный переход. Эльбрус - не может.
Member
Статус: Не в сети Регистрация: 12.09.2010 Откуда: Калининград
mogler писал(а):
К примеру 1 команда x86 = 5 микрооперациям.
Код:
addl 8(%esi, %edi, 4), %eax
add eax, [esi+edi*4+8] получится 3-4 микрооперации( вычисление такого сложного адреса может 1 или 2 микрооперации занимать, на пентиум 4 должно быть 2, на более новых ЦП будет 1 ) add [esi+edi*4+8], eax получится 4 или более
Нет. Налепить блоки - только часть задачи. А вот загрузить их - вторая часть. Если не делать планировщик команд, а тупо выгребать поток микроопераций из памяти - получим тупой как валенок VLIW.
В Эльбрусе этим занимается компилятор, в суперскалярах - аппаратура.
NiTr0 писал(а):
с ограничением по частоте ввиду сложности создания проводников равной длины от кешей/регистров к исполнительным блокам
Ядро Эльбруса намного проще аппаратных внеочередного исполнение и предсказания ветвления.
NiTr0 писал(а):
Код:
for (i=1; i<n; i++) array[i]+=array[i-1]*i;
на х86 (с внеочередным исполнением и т.п.) и vliw?
Нет. Там, где много условных переходов - эльбрус сольется. Ну ессно разве что компилятор циклы развернет, и вместо 1 кб получится пару мегабайт кода Ширина VLIW таки тоже десятки команд И да, CISC, как я уже говорил, может запустить на исполнение команды до того как произошел условный переход. Эльбрус - не может.
Цитата:
Глава 3. Микропроцессоры с архитектурой «Эльбрус»
Спекулятивный режим выполнения команд. Параллельному выполнению команд препятствуют не определяемые при компиляции зависимости по управлению и зависимости по данным. Выполняя операции раньше, чем становится известно направление условного перехода, или считывая дан- ные из памяти раньше предшествующей записи в память, можно ускорить выполнение программы. Но подобное перемещение операций не всегда до- пустимо из-за неопределенности их поведения при исполнении. В первом случае (выполнение раньше условного перехода) операция, которая не должна выполняться, может вызвать прерывание. Во втором случае может быть считано неправильное значение, если адреса совпадут. Архитектура «Эльбрус» определяет спекулятивный режим выполнения, в котором факт прерывания фиксируется, но реакция на него откладыва- ется до продолжения выполнения ветви программы в неспекулятивном режиме. Дополнительно для операций обращения в оперативную память вводится частично ассоциативная память (кэш-память), которая позволяет определять нарушения заданного в программе порядка обращения с совпа- дающими адресами по чтению и записи. Факты нарушений фиксируются и проверяются в неспекулятивном режиме. При обнаружении нарушений вы- полняются повторные чтения из памяти и, если это необходимо, операции, которые уже использовали результат неверного чтения, отменяются.
Подготовка передачи управления. Предварительная подкачка кода в на- правлении ветвления, а также его первичная обработка на дополнительном конвейере (на фоне выполнения основной ветви) скрывают задержку по доступу к коду программы при передачах управления и тем самым позволя- ют выполнить передачу управления без остановки конвейера выполнения, когда уже известно условие ветвления. Архитектура микропроцессора определяет средства предварительной подкачки кода для трех команд пере- дачи управления.
Предикатный режим выполнения команд. В этом режиме до вычисления условия могут исполняться обе ветви, но после вычисления результаты вы- полнения «неправильной» ветви в ее конвейере аннулируются. Для реали- зации этого принципа используется дополнительный операнд — предикат, который разрешает либо отменяет исполнение. Архитектура микропроцес- сора определяет в каждой широкой команде до 6 предикатов, которые могут управлять выполнением 8 операций.
Member
Статус: Не в сети Регистрация: 12.09.2010 Откуда: Калининград
mogler писал(а):
с ограничением по частоте ввиду сложности создания проводников равной длины от кешей/регистров к исполнительным блокам
mogler писал(а):
Ядро Эльбруса намного проще аппаратных внеочередного исполнение и предсказания ветвления
Тем не менее, итоговая площадь ядра 380 мм^2 у Э-4С, это нельзя игнорировать. Например, если результат из ALU сразу нужен в FPU, х86 процессоры могут вставлять задержку 1 такт - это время которое необходимо для доставки данных через большое расстояние между ALU и FPU, слишком большое при частотах в несколько гигагерц. С VLIW это должен делать компилятор, и это ещё одна привязка к конкретному ЦП получается. У CISC/RISC всё прозрачно, ЦП могут 2 такта ждать или не ждать вообще, это ничего не меняет внешне кроме итоговой производительности Но это не проблема всё равно. Они у себя могут компилить под конкретный ЦП, а для мейнстрима есть бинарная трансляция
Стоить учесть, что в Intel процессорах есть граф. ядро, так что разница не настолько большая. При этом Эльбрус обладает весьма богатым набором дополнительных блоков.
Industrialice писал(а):
Например, если результат из ALU сразу нужен в FPU, х86 процессоры могут вставлять задержку 1 такт - это время которое необходимо для доставки данных через большое расстояние между ALU и FPU, слишком большое при частотах в несколько гигагерц. С VLIW это должен делать компилятор, и это ещё одна привязка к конкретному ЦП получается.
Цитата:
Глава 3. Микропроцессоры с архитектурой «Эльбрус»
В отличие от других архитектур, здесь для выполнения операций над целы- ми и вещественными числами используется общий регистровый файл, что позволяет более эффективно использовать его объем и устранить допол- нительные пересылки между различными регистровыми файлами.
Квадраты Intel Core i5-2500K 32 нм 216 мм^2 -> 65*65/32*32*216=891 Intel Core i5-4670K 22 нм 177 мм^2 -> 65*65/22*22*177=1545 Я бы не стал всё равно так сравнивать
Ты сам предложил. Тогда посчитаем транзисторы. Эльбрус-2С+ 368 млн. // 2 ядра, Кэш 2048 (l2), 4 DSP ядра Intel Pentium G860 504 млн. // 2 ядра, Кэш 3584 (l2+l3)
Industrialice писал(а):
У х86 процессор может и не дожидаться записи в регистровый файл со стороны ALU чтобы прочитать его со стороны FPU. Это в любом случае был всего лишь пример, тема сложная и про особенности оптимизации микроархитектуры для достижения высоких частот разве что инженеры, которые этим занимаются, толково расскажут. Суть примера в том, что в случае CISC/RISC гибкость велика при применении оптимизаций которые будут внешне прозрачны
В x86, ALU работает со своим регистровым файлом, FPU со своим, SIMD со своим. Возможно в какой-то из реализаций микроархитектур усложнили связи между ALU и FPU, чтобы выполнить за 1 такт (как двухэтажные операции в Эльбрусе) или записывать результат сразу в РгФ FPU, но это скажется негативно на частоте. От себя добавлю, что x86 это черный ящик для программиста.
Квадраты Intel Core i5-2500K 32 нм 216 мм^2 -> (65*65)/(32*32)*216=891 Intel Core i5-4670K 22 нм 177 мм^2 -> (65*65)/(22*22)*177=1545 Я бы не стал всё равно так сравнивать
mogler писал(а):
В отличие от других архитектур, здесь для выполнения операций над целы- ми и вещественными числами используется общий регистровый файл, что позволяет более эффективно использовать его объем и устранить допол- нительные пересылки между различными регистровыми файлами.
Можно привести другой пример, FPU блок вызывает load или store для данных. store/load юниты находятся среди ALU, в итоге для FPU получаем ту же самую задержку пересылки данных, для ALU её не будет. Регистровый файл в данном случае явным образом только 1 используется и явной нету разницы разделены ли файлы FPU и ALU. Но какая на самом деле реализация одним инженерам Intel известно. Но я ставлю на то что это просто тайминг для того чтобы эта задача не сдерживала тактовую частоту ЦП
Последний раз редактировалось Industrialice 08.01.2015 22:57, всего редактировалось 1 раз.
Member
Статус: Не в сети Регистрация: 12.09.2010 Откуда: Калининград
mogler писал(а):
Ты сам предложил. Тогда посчитаем транзисторы. Эльбрус-2С+ 368 млн. // 2 ядра, Кэш 2048 (l2), 4 DSP ядра Intel Pentium G860 504 млн. // 2 ядра, Кэш 3584 (l2+l3)
А что это даст?
mogler писал(а):
x86 это черный ящик для программиста
По-моему для программиста инфы достаточно, но эта инфа типа "это даёт такой результат", но нет объяснений почему именно так, эта проприетарная инфа не уходит за пределы стен Intel/AMD, по крайней мере не в массы. Такие пояснения уже всё равно не помогут программировать эффективнее
Девы конференции оверклокерс надеюсь в курсе что у них сортировка сообщений по времени размещения глючит
Сейчас этот форум просматривают: нет зарегистрированных пользователей и гости: 20
Вы не можете начинать темы Вы не можете отвечать на сообщения Вы не можете редактировать свои сообщения Вы не можете удалять свои сообщения Вы не можете добавлять вложения