Инворматика. Требования по оформлению отчетов по лабораторным работам для студентов ВУЗ (2022 год)

 

  Главная      Книги - Разные 

 

поиск по сайту            правообладателям  

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Инворматика. Требования по оформлению отчетов по лабораторным работам для студентов ВУЗ (2022 год)

 

 

Требования по оформлению отчетов по лабораторным работам
Отчет о выполненной работе должен содержать следующие части:
1. Титульный лист. Оформляется в соответствии с текущими
требованиями, принятыми в ВУЗе.
2. Оформление текста согласно текущим требованиям принятым в
ВУЗе для оформления отчетов лабораторных работ.
3. Постановка задачи. Содержимое этого раздела должно быть
конкретизировано под выполняемый вариант работы.
4. Краткие теоретические сведения. Теоретические сведения должны
быть конкретизированы под выполняемый вариант работы.
5.
Описание программной реализации метода. В этом разделе
приводится описание в виде текста или блок схем реализуемых алгоритмов и
методов анализа данных.
6. Тестирование реализованного метода. В этом разделе приводятся
результаты работы реализованного в виде программы метода анализа
данных. Результаты могут быть представлены в виде таблиц, графиков или
снимков экрана.
7. Выводы. В этом разделе должны быть представлены выводы об
обнаруженных свойствах и закономерностях реализованного метода анализа
данных.
8.
Список использованных источников. Приводится список
использованных источников, оформленный в соответствии с текущими
требованиями, принятыми в ВУЗе.
Примечание. Исходные тексты программы не надо включать в отчет.
Они должны быть предоставлены в электронном виде вместе с исполняемым
файлом программы реализующей выданный вариант работы.
Требования к реализации
Используемый язык программирования - любой на выбор студента.
Желательно использовать
современные
языки
и платформы
программирования: Python, C++, Delphi, Java, C# и т.д.; современные
программные средства для выполнения математических и технических
расчетов Matlab, Mathcad.
Интерфейс пользователя - желательно реализовывать дружественный
визуальный интерфейс пользователя в виде диалоговых окон. Это ускоряет и
упрощает процедуру тестирования программы при ее приемке
преподавателем. Консольный вариант интерфейса программы так же
допустим.
При сдаче программы преподавателю во время контрольного запуска
программы она не должна выдавать сообщений об ошибках типа «Деление на
ноль»,
«Переполнение» и т.п. Такие программы будут отправляться на
доработку.
Для сдачи программа должна быть предоставлена в виде исполняемого
модуля, при необходимости укомплектованная всеми нужными внешними
библиотеками, так как на компьютере преподавателя может не быть той
инструментальной среды, которую выбрал студент для реализации работы.
Исходные тексты программы должны быть отформатированы и
содержать достаточное для понимания логики программы количество
комментариев. Исходный текст программы обычно используется для
проверки «авторства» студента при сдаче работы.
Исполняемый модуль и носитель
(флэшка), на котором он
предоставляется для проверки преподавателю, должны быть предварительно
проверены на вирусы.
Лабораторная работа 1 Анализ статистических данных
Цель работы: Приобретение навыков первичной обработки
эмпирических данных.
Задание
По имеющимся в таблице 1.1 данным по группе из 20 студентов очного
отделения необходимо:
1. В соответствии с вариантом выбрать данные из таблицы исходных
данных.
2.
Упорядочить исходные данные
(провести сортировку по
возрастанию)
3. На основе исходных данных определить:
а) среднее значение показателя, моду и медиану;
б) размах вариации, среднее линейное отклонение, дисперсию,
стандартное отклонение, коэффициент вариации;
в) проверить распределение на нормальность с помощью
коэффициентов асимметрии и эксцесса.
4. На основе исходных данных построить дискретный вариационный
ряд и определить:
а) среднее значение показателя, моду и медиану;
б) размах вариации, среднее линейное отклонение, дисперсию,
стандартное отклонение, коэффициент вариации;
в) первый и третий квартили;
г) построить диаграммы распределения.
5.
На основе исходных данных построить интервальный
вариационный ряд с равными интервалами. Число интервалов задано в
каждом варианте. Определить:
а) среднее значение показателя, моду и медиану;
б) размах вариации, среднее линейное отклонение, дисперсию,
стандартное отклонение, коэффициент вариации;
в) первый и третий квартили;
г) построить диаграммы распределения.
6. Провести сравнительный анализ полученных результатов.
7. Оформить отчет.
Таблица 1.1 - Исходные данные
Вариант
1
2
3
4
5
6
7
8
9
10
Время
п/п
Тет-
Воз-
Соот-
Стаж
Кол-во
Рост,
Вес,
Доход,
IQ (тест
решения
радь,
раст,
ношение
работы,
друзей,
см
кг
у.е./мес.
Айзенка)
контрольной,
листов
лет
«рост/вес»
мес.
чел.
час.
1
159
45
430
95
24
20
3,533
26
5
8,5
2
160
61
640
115
32
25
2,623
63
7
6,2
3
161
56
610
111
24
28
2,875
94
10
6,8
4
162
48
330
97
24
19
3,375
16
4
12,0
5
162
54
420
105
60
23
3,000
49
2
7,5
6
164
58
290
98
16
20
2,828
14
6
10,0
7
166
51
480
109
90
26
3,255
78
9
7,2
8
169
62
610
120
24
19
2,726
10
5
4,2
9
170
70
840
122
48
30
2,429
130
10
3,5
10
170
72
330
92
24
20
2,361
20
3
9,5
11
171
73
560
110
16
28
2,342
86
8
7,8
12
171
64
450
102
48
21
2,672
29
4
8,0
13
172
73
350
108
32
26
2,356
75
7
6,0
14
174
68
310
100
48
21
2,559
22
4
4,8
15
176
81
380
104
64
20
2,173
32
1
8,6
16
176
84
340
104
48
19
2,095
21
5
10,0
17
178
76
660
128
90
27
2,342
96
8
4,5
18
181
90
450
106
48
26
2,011
70
9
12,5
19
183
68
540
105
32
23
2,691
59
6
10,5
20
192
95
750
117
60
27
2,021
98
4
6,5
Методические указания к лабораторной работе №1
1. Общие сведения
Анализ данных включает три основных этапа:
1. Сбор.
2. Подготовка.
3. Обработка данных.
Данные по виду можно подразделить на числовые и категориальные.
Числовые данные (Numerical Data) - это данные, характеризующие
состояние какого-либо параметра изучаемого объекта. Наиболее часто такие
данные бывают представлены вещественными числами. Примерами
числовых данных являются заработная плата, население страны,
артериальное давление, температура воздуха.
Категориальные данные
(Categorical Data)
- это данные,
образующие признак принадлежности к какой-либо группе. Примерами
категориальных данных являются экзаменационная оценка, цвет автомобиля,
уровень образования человека.
Сбор данных - процесс формирования структурированного набора
данных в цифровой форме. В некоторых случаях процесс сбора данных
может включать также этап оцифровки.
Как правило, оцифрованные данные бывают представлены в виде:
электронных таблиц в форматах XLS либо ODS;
- текстовых файлов в формате CSV;
- веб-страниц в формате HTML;
- файлов в формате XML;
-
базы данных с доступом по технологии JSON либо через
специализированный интерфейс (API).
В случаях, когда источники данных структурированы и представлены в
сети Интернет, возможна реализация автоматизированного сбора данных.
Для использования в системах анализа данные должны быть
представлены в определенном, как правило, табличном виде. Однако
зачастую наборы данных имеют следующие особенности:
- отличную от табличной форму представления;
- пропуски отдельных данных;
- некорректные значения;
- большие числовые значения;
- текстовые данные.
Перечисленные особенности могут либо привести к затруднениям в
процессе дальнейшей обработки данных, либо сделать её невозможной. Для
устранения отмеченных несоответствий могут быть применены следующие
операции:
- структурирование - приведение данных к табличному (матричному) виду;
- отбор
- исключение записей с отсутствующими или некорректными
значениями;
- нормализация
- приведение числовых значений к определенному
диапазону, например к диапазону 0...1;
- кодирование
- это представление категориальных данных в числовой
форме. Например, при бинарной классификации один из классов можно
представить числом «0», а другой класс - числом «1». При множественной
классификации система кодирования несколько усложняется: создается
несколько числовых полей по количеству классов в выборке данных, каждый
класс кодируется проставлением числа «1» в соответствующем поле.
Статистические данные, как правило, представляются в виде числовых
таблиц больших размеров. Если пытаться анализировать данные,
просматривая таблицу, потребуются большие затраты времени и, чаще всего,
целый ряд свойств данных останется не выявленным, поскольку
представление информации в виде чисел лишено наглядности и не дает
конкретного визуального указания о наличии этих свойств. Более
информативно для анализа использование графического отображения данных
построение полигона (в случае дискретного признака) или гистограммы ( в
случае непрерывного признака).
Полигоном частот называют ломаную, отрезки которой соединяют
точки (x1, n1), (x2, n2), «, (xk, nk).
Для построения полигона частот на оси абсцисс откладывают варианты
xi, а на оси ординат ni. Точки (xi, ni) соединяют отрезками прямых и получают
полигон частот.
1. Пример. В результате выборки получена следующая таблица
распределения частот.
2
6
12
3
10
7
Рисунок 1 - Полигон частот
Гистограммой частот называют ступенчатую фигуру, состоящую из
прямоугольников, основаниями которых служат частичные интервалы
длиною h, а высоты равны отношению
(плотность частоты).
Рисунок 2 - Гистограмма частот
Для построения гистограммы частот на оси абсцисс откладывают
частичные интервалы, а над ними проводят отрезки, параллельные оси
абсцисс, на расстоянии .
Площадь i-го частичного прямоугольника равна
= ─ сумме частот
вариантi-го интервала; следовательно, площадь гистограммы частот равна
сумме всех частот, то есть объему выборки n.
На рисунке 2 изображена гистограмма частот распределения объема
n=100, приведенного в таблице 1.1.
Таблица 1.1 - Вспомогательная таблица
Частичный интервал,
Сумма частот вариант
Плотность
длиною h=5
частичного интервала
частоты
5 - 10
4
0,8
10 - 15
6
1,2
15 - 20
16
3,2
20 - 25
36
7,2
25 - 30
24
4,8
30 - 35
10
2,0
34 - 40
4
0,8
Визуальный анализ полигона или гистограммы позволяет выявить
характер распределения данных и ответить на следующие шесть вопросов:
1. Какие значения типичны для заданного набора данных?
2. Как различаются между собой значения (диапазон значений)?
3. Сконцентрированы ли данные вокруг некоторого типичного
значения?
4. Какой характер имеет эта концентрация данных? В частности,
одинаков ли характер «затухания» для малых и больших значений данных?
5. Есть ли в заданном наборе такие значения, которые сильно
отличаются от остальных и требуют специальной обработки (выбросы)?
Можно ли сказать, что в целом это однородный набор или отчетливо
наблюдается наличие групп, которые надо анализировать отдельно?
При анализе полигонов или гистограмм иногда в данных можно
наблюдать выбросы (сильно отклоняющиеся значения), т.е. такие такие
значения, которые либо слишком велики, либо слишком малы. Существуют
два вида выбросов: ошибки и корректные, но «отличающиеся» значения
данных.
С ошибками справиться легко они сильно отличаются от остальных
значений на гистограмме. В этом случае нужно перепроверить данные, найти
ошибку и исправить это значение.
Более сложной является проблема выбросов корректных данных. Если
есть убедительное подтверждение того, что выбросы не соответствуют
изучаемым данным, то их можно просто удалить и анализировать оставшиеся
более согласованные между собой данные. При отсутствии достаточно
обоснованного аргумента для исключения выбросов можно выполнить два
различных анализа: один с учетом выбросов, другой - с исключением их. В
лучшем случае может оказаться, что наличие выбросов не имеет
существенного значения. Если два анализа дадут разные результаты, то
выводы могут быть менее определенными и неоднозначными. В современной
статистике в настоящее время разрабатываются устойчивые методы, в
которых применяется мощный вычислительный аппарат для учета наличия
выбросов.
Обычно в статистике предполагают, что распределение данных
приблизительно соответствует нормальному. Это объясняется тем, что
многие стандартные методы статистического анализа, например, вычисление
доверительных интервалов или проверка статистических гипотез, требуют
нормального распределения данных (хотя бы приблизительно). Зная свойства
нормального распределения и изучив внимательно гистограмму, важно
определить, являются ли данные нормально распределенными. Теоретически
нормальное распределение представляет собой гладкую гистограмму в
форме колокола без случайных отклонений. Кривая нормального
распределения
задается
функцией
плотности
распределения:
,
где a и σ2 -
параметры
распределения: a - математическое ожидание; σ2 - дисперсия данной
случайной величины. Для идеального набора нормально распределенных
данных такая кривая имеет следующий вид (рис. 3)
Рисунок 3 - Кривая нормального распределения для идеального
набора данных
Как видим, большинство чисел сконцентрировано в средней части
диапазона значений (центр колокола a), а оставшиеся значения с затуханием
симметрично располагаются по обе стороны от вершины колокола.
Величина σ характеризует ширину
(масштаб) колокола. Фактически
существует много кривых нормального распределения, форма которых
напоминает симметричный колокол. Эти кривые отличаются друг от друга
расположением центра и масштабом σ. Ниже показаны кривые нормального
распределения, построенные в разных масштабах.
Рисунок 4 - Кривые нормального распределения
Поскольку реальные наборы нормально распределенных данных носят
случайный характер, то они не имеют идеальную степень гладкости
гистограмм и содержат некоторые случайные отклонения от теоретической
кривой.
2. Вариационные ряды
Исследователь, интересующийся тарифным разрядом рабочих
механического цеха, провел опрос 100 рабочих. Расположим наблюдавшиеся
значения признака в порядке возрастания. Эта операция называется
ранжированием статистических данных. В результате получим следующий
ряд, который называется ранжированным:
1,1,..,1,2,2,...,2, 3,3,...,3,4,4,...,4, 5,5,...,5, 6,
6,...,6
  
4
6
12
16
44
18
Из ранжированного ряда следует, что исследуемый признак
(тарифный разряд) принял шесть различных значений: 1, 2, 3, 4, 5 и 6.
В дальнейшем различные значения признака будем называть
вариантами, а под варьированием
- понимать изменение значений
признака.
В зависимости от принимаемых признаком значений признаки делятся
на дискретно варьирующие и непрерывно варьирующие.
Тарифный разряд
- это дискретно варьирующий признак. Число,
показывающее, сколько раз встречается вариант х в ряде наблюдений,
называется частотой варианта
m
x
Вместо частоты варианта х можно рассматривать ее отношение к
общему числу наблюдений n, которое называется частостью варианта и
обозначается
w
:
x
m
m
x
x
w
(1.1)
x
n
m
x
x
Таблица, позволяющая судить о распределении частот (или частостей)
между вариантами, называется дискретным вариационным рядом (таблица
2.2).
Таблица 2.2 - Дискретный вариационный ряд
Тарифный разряд, х
Количество рабочих,
m
Доля рабочих,
w
x
x
1
4
0,04
2
6
0,06
3
12
0,12
4
16
0,16
5
44
0,44
6
18
0,18
Итого
100
1,00
Наряду с понятием частоты используют понятие накопленной
частоты, которую обозначаютmнак. Накопленная частота показывает, во
x
скольких наблюдениях признак принял значения, меньшие заданного
значения х. Отношение накопленной частоты к общему числу наблюдений n,
называют накопленной частостью и обозначают wнак. Очевидно, что
x
нак
нак
m
m
нак
х
х
w
(1.2)
x
n
m
x
x
Накопленные частоты (частости) для дискретного вариационного ряда,
заданного в таблице 1.2, вычислены в таблице 1.3.
Пусть необходимо исследовать выработку на одного рабочего-станоч-
ника механического цеха в отчетном году в процентах к предыдущему году.
Здесь исследуемым признаком х является выработка в отчетном году в
процентах к предыдущему. Это непрерывно варьирующий признак. Для
выявления характерных черт варьирования значений признака объединим в
группы рабочих, у которых величина выработки колеблется в пределах 10%
(всего было опрошено 117 рабочих). Сгруппированные данные представим в
таблице 2.3.
Таблица 2.3 - Расчет накопленных частот (частостей) для дискретного
вариационного ряда
нак
нак
Х
m
m
w
x
x
x
1
4
4
0,04
2
6
4+6=10
0,10
3
12
10+12=22
0,22
4
16
22+16=38
0,38
5
44
38+44=82
0,82
6
18
82+18=100
1,00
Итого
100
--
--
Таблица 2.4
- Группировка данных исследования выработки на одного
рабочего-станочника механического цеха в отчетном году
Исследуемый
Количество
Доля
Накопленная
Накопленная
признак,
рабочих,
рабочих,
частота,
частость,
нак
нак
m
w
m
w
Х
80-90
8
8/117
8
8/117
90-100
15
15/117
8+15=23
23/117
100-110
46
46/117
23+46=69
69/117
110-120
29
29/117
69+29=98
98/117
120-130
13
13/117
98+13=111
111/117
130-140
3
3/117
111+3=114
114/117
140-150
3
3/117
114+3=117
117/117=1
Итого
117
1
--
--
В таблице 2.4 частоты m показывают, во скольких наблюдениях
признак принял значения, принадлежащие тому или иному интервалу. Такую
частоту называют интервальной, а отношение ее к общему числу
наблюдений - интервальной частостью w. Таблицу, позволяющую судить о
распределении частот
(или частостей) между интервалами варьирования
значений признака, называют интервальным вариационным рядом.
В таблице
2.4. для верхних границ интервалов приведены
w
).
Интервальный вариационный ряд строят по данным наблюдений за
непрерывно варьирующим признаком, а также за дискретно варьирующим,
если велико число наблюдавших вариантов. Дискретный вариационный ряд
строят только для дискретно варьирующего признака.
Иногда интервальный вариационный ряд условно заменяют
дискретным. Тогда серединное значение интервала принимают за вариант х,
а соответствующую интервальную частоту - за
m
x
Для построения интервального вариационного ряда необходимо
определить величину интервала, установить полную шкалу интервалов и в
соответствии с ней сгруппировать результаты наблюдений.
Для определения оптимального постоянного интервала h часто
используют формулу Стерджесса:
x
x
m
ax
min
h
,
(1.3)
1
3,322lg
n
где
x
и
x
- соответственно максимальный и минимальный значения
m
ax
min
вариантов.
Если в результате расчетов h окажется дробным числом, то за величину
интервала следует взять либо ближайшее целое число, либо ближайшую
несложную дробь.
За начало первого интервала рекомендуется принять величину
a
x
h/2
; начало второго интервала совпадает с концом первого и равно
1
min
a
a
h
; начало третьего интервала совпадает с концом второго и равно
2
1
a
a
h
. Построение интервалов продолжается до тех пор, пока начало
3
2
следующего по порядку интервала не будет больше
x
. После установления
max
шкалы интервалов следует сгруппировать результаты наблюдений.
3. Средние величины
Статистическая средняя
величина является
обобщенной
характеристикой совокупности по определенному признаку. В средних
величинах погашаются индивидуальные различия единиц совокупности,
обусловленные случайными обстоятельствами, и находят выражение
общие, закономерные черты, свойственные всей совокупности явления.
Это свойство средних предопределяет использование их в качестве
основного метода статистической науки. Заметим, что только для
качественно однородных наблюдений имеет смысл вычислять средние
величины.
Определить среднюю во многих случаях можно через исходное
соотношение средней (ИСС) или логическую формулу средней (ЛФС):
Суммарное значение или объем осредняемого признака
ИСС
Число единиц или объем совокупности
Так, например, для расчета средней урожайности картофеля региона,
состоящего из нескольких областей, ИСС представляет собой следующее
отношение:
Валовой сбор
ИСС
Посевная площадь
Для каждого показателя, используемого в социально-экономическом
анализе, можно составить только одно истинное исходное соотношение для
расчета средней. Если, например, требуется рассчитать средний размер
вклада в банке, то ИСС будет следующим:
Сумма всех вкладов, руб
ИСС
Число вкладов
От того, в каком виде представлены исходные данные для расчета
средней, зависит, каким именно образом будет реализовано ее исходное
соотношение. В каждом конкретном случае для реализации ИСС
потребуется одна из следующих форм средней величины: средняя
арифметическая; средняя гармоническая; средняя геометрическая; средняя
квадратическая, кубическая и т.д.
Перечисленные средние относятся к степенным средним. Степенной
средней q-го порядка
x
называют такую среднюю, при замене которой
q
каждого наблюдения остается неизменной сумма q-тых степеней
наблюдений:
n
q,
q
x
x
(1.4)
i
q
i
1
где
x
- i-тый вариант усредняемого признака;
i
n - количество наблюдений;
q - положительное или отрицательное целое число.
Из формулы (1.4) получаем выражение для расчета степенной средней
q-ого порядка:
n
x
i
q
i
1
x
(1.5)
q
n
При q =1 имеем простую среднюю арифметическую (невзвешенную):
n
х
i
i
i
х
х
(1.6)
ариф
1
n
При q =-1 имеем среднюю гармоническую:
n
1
x
i
n
i1
x
х
1/
(1.7)
гарм
1
n
n
1
i
1
x
i
При q =2 имеет место средняя квадратическая, при q =3 - средняя
кубическая и т.д.
Средней геометрической
x
называют корень n-ной степени из
геом
произведения значений наблюдений
x ,
x
,...,
x
:
1
2
n
n
x
n
x
(1.8)
геом
i
i1
Можно показать, что
x
lim
x
геом
q
q0
Наиболее распространенной средней величиной является средняя
арифметическая. Простая
(невзвешенная) средняя арифметическая
рассчитывается по формуле (2.6). Далее среднюю арифметическую величину
будем обозначать x .
Если по наблюдениям построен вариационный ряд, то средняя
арифметическая величина имеет вид:
m
x
x
x
x
,
(1.9)
mx
x
где
х
- вариант, если ряд дискретный, и центр интервала, если ряд
интервальный;
m
- соответствующая частота;
n
m
x
x
x
Частоты
m
в формуле (2.9) называют весами, операцию умножения х
x
на
m
- операцией взвешивания, а среднюю арифметическую, вычисленную
x
по формуле (1.9) - средней арифметической взвешенной.
Среднюю арифметическую величину для вариационного ряда можно
вычислять по формуле:
x
w
,
(1.10)
x
x
x
которая является следствием формулы (2.9).
Действительно,
xm
x
m
m
x
x
x
x
x
x
xw
x
m
m
n
x
x
x
x
x
x
x
Рассмотрим основные свойства средней арифметической.
Сумма отклонений результатов наблюдений от средней арифметической равна
нулю.
Если все результаты наблюдений уменьшить (увеличить) на одно и то
же число, то средняя арифметическая уменьшится (увеличится) на то же
число.
Если все результаты наблюдений уменьшить (увеличить) в одно и тоже
число раз, то средняя арифметическая уменьшится (увеличится) во столько
же раз.
Если ряд наблюдений состоит из k групп наблюдений, то средняя
арифметическая всего ряда x равна взвешенной средней арифметической
групповых средних
x
, причем весами являются объемы групп
n
:
i
i
k
x
n
i
i
x
n
x
n
x
n
1
1
2
2
k
k
i1
x
(1.11)
k
n
n
n
1
2
k
n
i
i
1
Средняя арифметическая для сумм
(разностей) взаимно соответствующих
значений признака двух рядов наблюдений с одинаковым числом наблюдений равна
сумме (разности) средних арифметических этих рядов:
x
y
=x y, xy=x y.
Следствие. Средняя арифметическая алгебраической суммы соответствующих
значений признака нескольких рядов наблюдений равна алгебраической сумме средних
арифметических этих рядов.
Известно, что степенные средние разных видов, исчисленные по одной
и той же совокупности, имеет различные количественные значения. И чем
больше показатель степени, тем больше и величина соответствующей
средней:
x
x
x
x
гарм
геом
арифм
кв
Это свойство степенных средних возрастать с повышением показателя
степени определяющей функции называется мажорантностью средних.
Таблица 3.1 - Виды степенных средних и их применение
Название
Формула расчета средней
Когда
m
средней
простая
взвешенная
применяется
Чаще всего, кроме тех
Хi
Х
f
i
i
случаев, когда
1
Арифметическая
Х ар =
(1)
Х ар =
(2)
должны применяться
N
fi
другие виды средних
Для осреднения
величин с дробной
N
f
(3)
размерностью при
Х ГМ =
Х ГМ =
(4)
-1
Гармоническая
1
наличии
if
дополнительных
X
X
i
i
данных по числителю
дробной размерности
N
N
Для осреднения
f
i
0
Геометрическая
X геом
N
X
(5)
X геом
N
X
(6)
цепных индексов
i
i
динамики
i1
i1
2
Для осреднения
2
Х
f
Xi
i
i
вариации признака
2
Квадратическая
Х кв =
(8)
Х кв =
(7)
(расчет средних
N
fi
отклонений)
3
3
Х
f
Xi
i
i
Для расчета индексов
3
Кубическая
Х куб = 3
(10)
Х куб =3
(9)
нищеты населения
N
fi
1
Для осреднения
X
X N
1
N
(X
X
)
f
X
i
i
i1
i
моментных
1
Хронологическая
2
X
ХР
(12)
2
(11)
X ХР
статистических
2
f
N
1
величин
Помимо степенных средних, в статистической практике также
используются позиционные средние, среди которых наиболее распространены
мода и медиана.
Медианой
М
называют значение признака, приходящегося на
е
середину ранжированного ряда наблюдений, если проведено нечетное число
наблюдений n 2 l1, а результаты наблюдений проранжированы и
выписаны в следующий ряд:
x
, x
,..., x
, x
, x
,..., x
, x
,
1
2
l 1
l
l 1
n1
n
где
x
- значение признака, занявшее i-ое порядковое место в
i
ранжированном ряду.
На середину ряда приходится значение
x
, следовательно
М
=
x
l
е
l
Если проведено четное число наблюдений n=2l, то на середину
ранжированного ряда
x
, x
,..., x
, x
, x
,..., x
, x
,
приходятся значения
1
2
l 1
l
l 1
n1
n
x
и
x
. В этом случае за медиану принимают среднюю арифметическую
l
l1
x
x
l
l1
значений
x
и
x
-
M
l
l1
e
2
Для интервального вариационного ряда медиана определяется по
формуле:
,
f
f
Me1
Me
X
h
(1.12)
Me
f
Me
Если в формуле (2.12) числитель и знаменатель входящей в нее дроби
разделить на n, то получим другую формулу для расчета
М
:
е
нак
0,5w
e
M
a
h
,
(1.13)
e
e
we
где XMe - нижняя граница медианного интервала;
h - его величина (размах);
f
(w
нак )
– сумма наблюдений (или объема взвешивающего признака),
Me1
e
накопленная до начала медианного интервала;
f
– число наблюдений или объем взвешивающего признака в
e
M w
e
медианном интервале.
Медианным называется интервал, у которого первый раз накопленная
частота (частость) станет равной или более половины всех наблюдений ( 0,5).
Модой (
M
) называют такое значение признака, которое наблюдалось
o
наибольшее число раз.
Для дискретного вариационного ряда модой является вариант,
которому соответствует наибольшая частота (частость).
В случае интервального вариационного ряда мода вычисляется по
следующей формуле:
f
f
Mo
Mo1
Mo
X
h
(1.14)
Mo
2f
f
f
Mo
Mo1
Mo1
или по тождественной формуле:
w
w
'
o
o
M
X
h
(1.15)
o
M
0
2w
w
'w
"
o
o
o
где ХMo - нижнее значение модального интервала, то есть такого, которому
соответствует наибольшая частота (частость);
f
- частота (частость) модального интервала;
0
M w
o
f
- частота
(частость) интервала, предшествующего
0
1
M w '
o
модальному;
f
- частота (частость) интервала, следующего за модальным.
0
1
M w "
o
h - величина интервала изменения признака в группах.
4. Практическое задание
Задача 1. Имеются следующие данные о возрастном составе студентов
группы заочного отделения ВУЗа (лет): 19; 19; 19; 20; 20; 20; 20; 20; 20; 20;
20; 20; 21; 21; 21; 22; 23; 23; 24; 25; 25; 25; 26; 27; 29.
Для анализа распределения студентов по возрасту требуется:
1) построить интервальный ряд распределения и его график;
2) рассчитать модальный, медианный и средний возраст, установить
его типичность с помощью коэффициентов вариации;
3)
проверить распределение на нормальность с помощью
коэффициентов асимметрии и эксцесса.
Решение. Для построения интервального ряда из дискретного
используется формула Стерджесса, с помощью которой определяется
оптимальное количество интервалов (n):
n = 1 +3,322 lg N,
(1.16)
где N - число величин в дискретном ряде.
В нашей задаче n = 1 + 3,322lg25 = 1 + 3,322*1,398 = 5,64. Так как
число интервалов не может быть дробным, то округлим его до ближайшего
целого числа, т.е. до 6.
После определения оптимального количества интервалов определяем
размах интервала по формуле:
h = H / n,
(1.17)
где H - размах вариации, определяемый по формуле
(1.18).
H = Хмах min,
(1.18)
где Xмax и Xmin — максимальное и минимальное значения в совокупности.
В нашей задаче h = (29 - 19)/6 = 1,67.
Интервальная группировка данных приведена в первом столбце
таблицы 4.1, которая содержит также алгоритм и промежуточные расчеты.
Таблица 4.1 - Вспомогательные расчеты для решения задачи
Xi , лет
fi
ХИ
XИfi
ХИ- Х
X -
X
f
И- Х )2
И- Х )2fi
И- Х )3 fi
И- Х )4 fi
И
i
до 20,67
12
19,833
237,996
-2,134
25,602
4,552
54,623
-116,539
248,638
20,67-22,33
4
21,5
86,000
-0,467
1,866
0,218
0,871
-0,406
0,189
22,33-24
3
23,167
69,501
1,200
3,601
1,441
4,323
5,190
6,231
24-25,67
3
24,833
74,499
2,866
8,599
8,217
24,650
70,659
202,543
25,67-27,33
2
26,5
53,000
4,533
9,067
20,552
41,105
186,348
844,806
более 27,33
1
28,167
28,167
6,200
6,200
38,446
38,446
238,383
1478,091
Итого
25
549,163
54,937
164,018
383,636
2780,498
На основе этой группировки строится график распределения возраста
студентов (рис.5).
13
12
12
11
10
9
8
7
6
5
4
4
3
3
3
2
2
1
1
0
19-20,67
20,67-22,33
22,33-24
24-25,67
25,67-27,33
27,33-29
Возраст, лет
Рисунок 5 - График распределения возраста студентов
Мода - это наиболее часто повторяющееся значение признака. Для
интервального ряда с равными интервалами величина моды определяется по
формуле (13):
f
f
Mo
Mo1
Mo
X
h
,
(13)
Mo
2f
f
f
Mo
Mo1
Mo1
где ХMo - нижнее значение модального интервала;
fMo
- число наблюдений или объем взвешивающего признака
(вес
признака) в модальном интервале;
fMo-1 - то же для интервала, предшествующего модальному;
fMo+1 - то же для интервала, следующего за модальным;
h - величина интервала изменения признака в группах.
В нашей задаче чаще всего повторяется (12 раз) первый интервал
возраста
(до
20,67), значит, это и есть модальный интервал. Используя
формулу (13), определяем точное значение модального возраста:
Мо = 19 + 1,667*(12-0)/(2*12-4-0) = 20 (лет).
Медиана
- это такое значение признака, которое приходится на
середину ранжированного ряда. Таким образом, в ранжированном ряду
распределения одна половина ряда имеет значения признака больше
медианы, другая - меньше медианы. Для интервального ряда с равными
интервалами величина медианы определяется так:
,
f
f
Me1
Me
X
h
,
(14)
Me
f
Me
где XMe - нижняя граница медианного интервала;
h - его величина (размах);
f
- сумма наблюдений
(или объема взвешивающего признака),
Me
1
накопленная до начала медианного интервала;
fMe
- число наблюдений или объем взвешивающего признака в
медианном интервале.
В нашей задаче второй интервал возраста (от 20,67 до 22,33) является
медианным, так как на него приходится середина ряда распределения
возраста. Используя формулу
(14), определяем точное значение
медианного возраста:
Ме = 20,67 + 1,667*(12,5-12)/4 = 20,878 (года).
Средняя величина
- это обобщающий показатель совокупности,
характеризующий уровень изучаемого явления или процесса. Средние
величины могут быть простыми и взвешенными. Простая средняя
рассчитывается при наличии двух и более статистических величин,
расположенных в произвольном (несгруппированном) порядке, по общей
формуле
(15). Взвешенная средняя величина рассчитывается по
сгруппированным статистическим величинам с использованием общей
формулы (16).
m
m
X
f
X
i
i
i
X =m
(15)
X =m
(16)
N
f
i
При этом обозначено: Xi - значения отдельных статистических величин
или середин группировочных интервалов; m
- показатель степени, от
значения которого зависят виды средних величин.
В нашей задаче, применяя формулу Error! Reference source not found.
и подставляя вместо
Х
середины интервалов возраста ХИ, определяем
i
средний возраст студентов: Х ар = 549,163/25 = 21,967 (года).
Теперь осталось определить типичность или нетипичность найденной
средней величины. Это осуществляется с помощью расчета показателей
вариации. Чем ближе они к нулю, тем типичнее найденная средняя величина
для изучаемой статистической совокупности. При этом критериальным
значением коэффициента вариации служит 1/3.
Коэффициенты вариации рассчитываются как отношение среднего
отклонения к средней величине. Поскольку среднее отклонение может
определяться линейным и квадратическим способами, то соответствующими
могут быть и коэффициенты вариации.
Среднее линейное отклонение определяется по формулам
(1.23) и
(1.24):
X
X
i
Л
- простое;
(1.23)
N
X
X
f
i
i
Л
- взвешенное.
(1.24)
fi
Среднее квадратическое отклонение определяется
как
корень
квадратный из дисперсии, то есть по формуле (1.25):
Д . (1.25)
Дисперсия определяется по формулам (17) или (1.27):
2
X
X
i
Д
– простая;
(17)
N
X
X
2
f
i
i
Д
- взвешенная.
(1.27)
f
i
В нашей задаче, применяя формулу (1.24), определим ее числитель и
внесем в расчетную таблицу. В итоге получим среднее линейное отклонение:
Л = 54,937/25 = 2,198 (года). Разделив это значение на средний возраст,
Л
получим линейный коэффициент вариации:
= 2,198/21,967
= 0,100.
Х
По значению этого коэффициента для рассмотренной группы студентов
делаем вывод о типичности среднего возраста, т.к. расчетное значение
коэффициента вариации не превышает критериального (0,100 < 0,333).
Применяя формулу (1.27), получим в итоге дисперсию: Д = 164,018/25
= 6,561. Извлечем из этого числа корень и получим в результате среднее
квадратическое отклонение: =
Д = 2,561 (года). Разделив это значение на
средний возраст, получим квадратический коэффициент вариации:
 
=
Х
2,561/21,967 = 0,117. По значению этого коэффициента для рассмотренной
группы студентов можно сделать вывод о типичности среднего возраста, т.к.
расчетное значение коэффициента вариации не превышает критериального
(0,117 < 0,333).
В качестве показателей асимметрии используются: коэффициент
асимметрии
- нормированный момент третьего порядка
(1.28) и
коэффициент асимметрии Пирсона (1.29):
3
r
,
(1.28)
3
3
X Mo
As
(1.29)
Если значение коэффициента асимметрии положительно, то в ряду
преобладают варианты, которые больше средней
(правосторонняя
скошенность), если отрицательно
- левосторонняя скошенность. Если
коэффициент асимметрии равен 0, то вариационный ряд симметричен.
3
X
X
f
i
i
3
В нашей задаче
=
=383,636/25
= 15,345;
=2,5613=
3
fi
16,797;
r
=15,345/16,797 = 0,914 > 0, значит, распределение студентов по
3
росту с правосторонней асимметрией. Это подтверждает и значение
коэффициента асимметрии Пирсона: As = (21,967-20)/2,561 = 0,768.
Для характеристики крутизны распределения используется
центральный момент 4-го порядка:
4
X
X
f
i
i
=
(1.30)
4
fi
Для образования безразмерной характеристики определяется
4
нормированный момент
4-го порядка
r
, который и характеризует
4
4
крутизну
(заостренность) графика распределения. При измерении
асимметрии эталоном служит нормальное (симметричное) распределение,
для которого
r
=3. Поэтому для оценки крутизны данного распределения в
4
сравнении с нормальным вычисляется эксцесс распределения (1.31):
4
Ex
3
. (1.31)
4
Для приближенного определения эксцесса может быть использована
формула Линдберга (18):
Ex
d
0,3829
, (18)
/
2
где
d
– доля количества вариант, лежащих в интервале, равном
/
2
половине (в ту и другую сторону от средней величины).
В нашей задаче числитель центрального момента
4-го порядка
рассчитан в последнем столбце расчетной таблицы. В итоге по формуле
(1.31) имеем: Ex = (2780,498/25)/2,5614-3 = 111,220/43,017-3 = -0,415. Так как
Ex<0, то распределение низковершинное. Это подтверждает и
приблизительный расчет по формуле (18): в интервале 21,967 0,5*2,561, то
есть от
20,687 до
23,248 находится примерно
21,4% студентов. Таким
образом, Ex = 0,214 - 0,3829 = -0,169.
Вопросы к защите лабораторной работы №1
1. Дайте определение случайной величины.
2. В чем отличие случайной переменной от неслучайной
(детерминированной)? Какие виды случайных переменных Вы знаете?
Приведите примеры.
3. Перечислите основные вероятностные характеристики дискретных
случайных величин и дайте их определения.
4. Что представляет собой дискретный вариационный ряд? Какие
характеристики можно рассчитать по данным вариационного дискретного
ряда?
5. Что представляет собой интервальный вариационный ряд? Какие
характеристики можно рассчитать по данным интервального вариационного
ряда?
6. В каком случае целесообразен переход от дискретного
вариационного ряда к интервальному?
7. Что такое полигон? Что такое гистограмма? Для каких целей они
используются?
8. Дайте понятие
«степенные средние». Для каких целей
используются эти характеристики?
9. Дайте понятие позиционные (или структурные) средние. Для каких
целей используются эти характеристики?
10.Перечислите основные характеристики разброса случайных
величин?

 

 

 

 

 

 

 

 

 

 

 

///////////////////////////////////////