Сбор и группировка статистических данных
Открываешь учебник, видишь столбик чисел и не понимаешь, что с ним делать? На контрольной нужно и упорядочить данные, и разбить их на группы, и сделать вывод. Знакомая боль — и она решаема: статистика в 8 классе устроена как конструктор…
Зачем в 8 классе собирают статистические данные
Открываешь учебник, видишь столбик чисел и не понимаешь, что с ним делать? На контрольной нужно и упорядочить данные, и разбить их на группы, и сделать вывод. Знакомая боль — и она решаема: статистика в 8 классе устроена как конструктор из нескольких понятных шагов.
Статистика изучает массовые явления. Одно измерение почти ничего не доказывает, а сотня измерений уже показывает закономерность. Например, рост одного восьмиклассника — просто число, а рост всех учеников класса позволяет говорить о среднем значении, о самом высоком и о том, насколько ребята отличаются друг от друга.
Сбор данных начинается с двух вопросов: что именно мы измеряем и у кого. Всю интересующую нас группу называют генеральной совокупностью, а ту её часть, которую реально измерили, — выборкой. Если опросить только друзей, вывод получится смещённым, и это самая частая ошибка новичка.
Дальше данные приводят в порядок: ранжируют, считают частоты, собирают в группы и только потом делают выводы. Именно этому посвящена статья. Хочешь увидеть, как статистика работает в настоящих заданиях, — посмотри разбор задания 17 ЕГЭ по математике (база).
Как собрать данные: совокупность, выборка, объём
Сбор данных — это не «опросил кого попало», а осознанный план. Сначала определяют генеральную совокупность: всех, о ком хотят сделать вывод. Потом решают, сколько наблюдений реально провести, — это объём выборки, обычно обозначают буквой n.
Способы сбора бывают разными: измерение (рост, время, температура), опрос, наблюдение, работа с готовыми документами — например, с классным журналом. В школьных задачах данные чаще всего уже даны списком, и твоя работа начинается со второго шага — обработки.
Главное требование к выборке — репрезентативность, то есть она должна отражать свойства всей совокупности. Если измерять время решения задачи только у отличников, среднее получится заниженным, и вывод про весь класс будет неверным.
Ещё одна тонкость: объём выборки напрямую влияет на надёжность вывода. Пять чисел легко перепутать случайностью, а сорок уже дают устойчивую картину. Что делать, если тема даётся тяжело с самого начала, разобрано в статье как готовиться к ЕГЭ по математике с нуля.
Ранжирование и таблица частот
Первый шаг обработки — ранжирование, то есть запись данных в порядке возрастания. Ранжированный ряд сразу показывает минимум, максимум и общую картину: видно, где числа кучкуются, а где есть разрывы.
Второй шаг — подсчёт частот. Абсолютная частота n(i) показывает, сколько раз встретилось значение, а относительная частота w(i) = n(i) ÷ n показывает его долю. Сумма всех абсолютных частот равна объёму выборки, а сумма относительных частот всегда равна 1.
Удобно оформить результат таблицей — так данные видно целиком.
| Значение x(i) | 3 | 4 | 5 | 6 | 7 | 8 |
|---|---|---|---|---|---|---|
| Частота n(i) | 2 | 4 | 6 | 4 | 3 | 1 |
| Доля w(i) | 0,1 | 0,2 | 0,3 | 0,2 | 0,15 | 0,05 |
Типичная ошибка — путать эти два столбца и писать в ответ «частота равна 0,3» там, где нужна абсолютная частота 6. Проверяй себя: сложи столбец n(i), должно получиться 20, сложи w(i) — должна получиться единица. Потренироваться в таких подсчётах удобно в личном кабинете с автоматической проверкой.
Группировка данных в интервалы
Когда разных значений много — например, рост, время или баллы, — таблица по каждому числу становится громоздкой. Тогда данные группируют в интервалы: соседние значения объединяют в промежутки одинаковой ширины и считают, сколько наблюдений попало в каждый.
Порядок действий такой: находим минимум и максимум, выбираем число групп k (обычно 4–7), вычисляем шаг h = (максимум − минимум) ÷ k, округляем его вверх и строим границы. Важно, чтобы интервалы не пересекались и покрывали весь диапазон.
Рост 20 восьмиклассников: минимум 148 см, максимум 172 см
k = 5 групп
h = (172 − 148) ÷ 5 = 24 ÷ 5 = 4,8 ≈ 5 см
Интервалы: 148–153, 153–158, 158–163, 163–168, 168–173
Результат оформляют таблицей частот по интервалам или столбчатой диаграммой. Ошибка здесь одна из самых частых: делают интервалы разной ширины, и тогда высокий столбик получается просто потому, что он «шире», а не потому, что там больше данных.
Округляй шаг вверх, а не вниз, и следи, чтобы последний интервал «накрыл» максимум. Иначе самое большое значение просто выпадет из таблицы, и сумма частот не сойдётся с объёмом выборки.
Разобранный пример: от сырых чисел до вывода
Разберём полный цикл обработки. Учитель проверил, сколько примеров решил каждый из 20 учеников, и получил такой список: 3, 5, 7, 4, 6, 5, 8, 4, 5, 6, 7, 5, 4, 6, 3, 5, 7, 6, 5, 4. Сначала ранжируем, затем посчитаем частоты и характеристики ряда.
Ранжированный ряд (n = 20):
3, 3, 4, 4, 4, 4, 5, 5, 5, 5, 5, 5, 6, 6, 6, 6, 7, 7, 7, 8
Среднее: (3·2 + 4·4 + 5·6 + 6·4 + 7·3 + 8·1) ÷ 20 = 105 ÷ 20 = 5,25
Мода: 5 (встречается 6 раз — чаще всех)
Медиана: (5 + 5) ÷ 2 = 5
Размах: 8 − 3 = 5
Теперь можно делать содержательный вывод: типичный ученик решил около пяти примеров, чаще всего встречается именно пять, а разброс составляет пять задач. Обрати внимание: среднее 5,25 совпало с модой 5 не случайно, но так бывает не всегда — при «тяжёлых» краях среднее уезжает в сторону.
Закрепить расчёты среднего, моды и медианы можно на коротких тренажёрах в бесплатной практике: пять заданий подряд дают куда больше, чем десять прочитанных примеров.
При чётном объёме выборки в середине два числа, и медиана — это их среднее арифметическое, а не одно из них. А моду ищут по частоте, а не по величине числа.
Что запомнить и что делать дальше
Соберём тему в короткую схему. Сначала определяем совокупность и выборку, затем ранжируем данные, считаем абсолютные и относительные частоты, а при большом числе разных значений группируем числа в равные интервалы с шагом h = (максимум − минимум) ÷ k.
Ключевые характеристики ряда — среднее арифметическое, мода, медиана и размах. Среднее чувствительно к крайним значениям, мода показывает самое частое, медиана делит ряд пополам, размах говорит о разбросе. Эти четыре числа и есть «портрет» данных.
Проверка на каждом шаге простая: сумма частот равна объёму выборки, сумма долей равна единице, интервалы не пересекаются и покрывают весь диапазон. Если всё сходится, вывод можно делать смело.
Следующий шаг — практика: зарегистрируйся и реши 5 заданий бесплатно, чтобы довести навык до автоматизма и не терять баллы на пустяках.
Чем генеральная совокупность отличается от выборки?
Генеральная совокупность — это все объекты, о которых нужно сделать вывод, а выборка — та часть, которую реально измерили или опросили. Вывод всегда строят по выборке, но распространяют на всю совокупность.
Что такое мода и медиана и чем они отличаются от среднего?
Мода — самое частое значение, медиана — число в середине ранжированного ряда. Среднее учитывает все значения и сильно меняется от крайних чисел, а мода и медиана к ним устойчивы.
Зачем группировать данные в интервалы, если можно считать по числам?
При большом числе разных значений таблица по каждому числу разрастается и становится нечитаемой. Интервалы сжимают информацию и делают структуру данных наглядной, особенно для роста, времени и баллов.
Как закрепить тему после разбора?
Возьми любой список из 20–30 чисел и пройди весь путь сам: ранжирование, таблица частот, группировка, среднее, мода, медиана, размах. Потом проверь сумму частот в личном кабинете.
Хочешь понимать предмет уверенно?
Репетитор Просто Урок разбирает сложные темы по шагам и даёт целевые тренировки. Регистрация занимает минуту.