Искра-226/Файловая система: различия между версиями

Материал из Emuverse
(new info)
(more info)
Строка 245: Строка 245:
|}
|}


Формула даёт точную границу, эвристический поиск начала программы не требуется. На расширенном наборе из 51 токенизированного файла она также не даёт сбоев: разбор каждого файла доходит до конца потока без рассинхронизации.
Формула даёт точную границу, эвристический поиск начала программы не требуется.
 
==== Четырёхбайтовое поле перед программой ====
 
У части файлов между таблицами и первой записью строки лежат '''четыре лишних байта''', и формула указывает на четыре байта раньше настоящего начала программы. В исследованном наборе так устроены 19 файлов из 94 — целиком одно семейство программ. Первые два байта поля всегда <code>0A 19</code>, вторые два — двоично-десятичное число, своё у каждого файла:
 
{| class="wikitable"
! Файл !! Поле !! Файл !! Поле
|-
| <code>BAM</code> || <code>0A 19 20 20</code> || <code>BAM00</code> || <code>0A 19 90 90</code>
|-
| <code>BAM1</code> || <code>0A 19 20 91</code> || <code>BAM9</code> || <code>0A 19 20 99</code>
|-
| <code>BAM10</code> || <code>0A 19 91 90</code> || <code>S_BAM01</code> || <code>0A 19 90 91</code>
|}
 
Признак защиты роли не играет: девять других файлов набора со значением байта 9, равным <code>25</code>, поля не имеют. Назначение поля не установлено; ни на запись строки, ни на запись таблицы 2 оно не раскладывается.
 
Определять наличие поля следует проверкой самой записи: по вычисленному смещению (после пропуска нулей выравнивания) оба байта номера строки должны быть правильным двоично-десятичным числом, байт длины — не меньше единицы, а байт по адресу <code>p + 2 + len</code> — равен <code>FE</code>. Если проверка не проходит, а по смещению +4 проходит, поле присутствует. На наборе это разделяет файлы без единой ошибки.
 
{{Внимание|1=Полагаться на «разбор сломается — попробуем сдвиг» нельзя. У файла <code>BAM1</code> мусорная запись по неверному смещению случайно оканчивалась байтом <code>FE</code>: разбор продолжался дальше и терял только первую строку программы.}}


==== Таблица 1 ====
==== Таблица 1 ====
Строка 377: Строка 397:


Правило проверено на всех файлах исследованного набора, разбор которых не срывается на бинарных полезных нагрузках операторов <code>ASMB</code> и <code>$GIO</code>: для 28 файлов совпадение точное.
Правило проверено на всех файлах исследованного набора, разбор которых не срывается на бинарных полезных нагрузках операторов <code>ASMB</code> и <code>$GIO</code>: для 28 файлов совпадение точное.
Независимое подтверждение даёт второй набор из 43 файлов, добавленный позже: соотношение «число записей с установленным битом 0 флага равно <code>L1 / 8</code>» (см. ниже) выполняется в нём '''для всех 43 файлов без исключения'''.


===== Флаг типа =====
===== Флаг типа =====
Строка 400: Строка 422:
===== Связь с таблицей 1 =====
===== Связь с таблицей 1 =====


Число записей с установленным битом 0 флага '''в точности равно <code>L1 / 8</code>''' во всех файлах набора. Более того, соответствие оказывается порядковым: ''k''-я по счёту такая запись (в порядке файла) описывает ту же переменную, что и ''k''-я запись таблицы 1.
Число записей с установленным битом 0 флага '''в точности равно <code>L1 / 8</code>''' во всех 94 файлах набора. Более того, соответствие оказывается порядковым: ''k''-я по счёту такая запись (в порядке файла) описывает ту же переменную, что и ''k''-я запись таблицы 1.


  k = 0
  k = 0
Строка 539: Строка 561:
|-
|-
| <code>36</code> || ''(присваивание без ключевого слова)'' || подтверждено
| <code>36</code> || ''(присваивание без ключевого слова)'' || подтверждено
|-
| <code>33</code> || ''(не опознан; операнды — две ссылки на переменные)'' || выведено из данных
|-
| <code>37</code> || ''(не опознан; операнд — один массив целиком)'' || выведено из данных
|-
|-
| <code>3A</code> || DEFFN' с текстовым определением || выведено из данных
| <code>3A</code> || DEFFN' с текстовым определением || выведено из данных
Строка 621: Строка 647:
|-
|-
| <code>71</code> || DATA LOAD DA || подтверждено
| <code>71</code> || DATA LOAD DA || подтверждено
|-
| <code>72</code> || ''(не опознан; операнды <code>T#n,(…)…</code>, встречается при загрузке сегмента)'' || выведено из данных
|-
|-
| <code>74</code> || DATA LOAD DC || выведено из данных
| <code>74</code> || DATA LOAD DC || выведено из данных
Строка 749: Строка 777:
|-
|-
| <code>0C</code> || <code>¤TRAN(</code> || подтверждено
| <code>0C</code> || <code>¤TRAN(</code> || подтверждено
|-
| <code>09</code> || MAT MOVE (?) || выведено из данных: <code>&lt;массив&gt;,&lt;выр.&gt;,&lt;выр.&gt; TO &lt;цель&gt;</code>
|-
| <code>0B</code> || MAT SORT || форма <code>&lt;массив&gt; TO &lt;массив&gt;,&lt;массив&gt;</code> совпадает с <code>MAT SORT B¤()TOQ¤(),L¤()</code> из текстового листинга
|-
| <code>0D</code> || <code>¤PACK</code> (?) || <code>(&lt;A¤&gt;=&lt;формат¤&gt;) &lt;B¤&gt; FROM &lt;выр.&gt;</code>
|-
| <code>0E</code> || <code>¤UNPACK</code> (?) || то же с <code>TO</code>
|-
|-
| <code>0F</code> || <code>¤OPEN</code> || подтверждено
| <code>0F</code> || <code>¤OPEN</code> || подтверждено
Строка 760: Строка 796:
| <code>19</code> || NPLOT || подтверждено
| <code>19</code> || NPLOT || подтверждено
|-
|-
| <code>1C</code> || ''(массив и четыре числа; вероятно <code>FRAME</code>)'' || выведено из данных
| <code>1C</code> || STRETCH || подтверждено
|-
|-
| <code>1E</code> || LABEL || подтверждено
| <code>1E</code> || LABEL || подтверждено
Строка 868: Строка 904:
| <code>E2</code> || шестнадцатеричный литерал <code>HEX(…)</code>: <code>E2 &lt;len&gt; &lt;len байт&gt;</code> || подтверждено
| <code>E2</code> || шестнадцатеричный литерал <code>HEX(…)</code>: <code>E2 &lt;len&gt; &lt;len байт&gt;</code> || подтверждено
|-
|-
| <code>E3</code> || строковый литерал: <code>E3 &lt;len&gt; &lt;len байт КОИ-8&gt;</code> || подтверждено
| <code>E3</code> || строковый литерал в кавычках: <code>E3 &lt;len&gt; &lt;len байт КОИ-8&gt;</code> || подтверждено
|-
| <code>E4</code> || строковый литерал в апострофах, кодирование то же || подтверждено
|-
|-
| <code>E5</code> || число с фиксированной точкой, см. ниже || подтверждено
| <code>E5</code> || число с фиксированной точкой, см. ниже || подтверждено
Строка 886: Строка 924:
| <code>EC</code>, <code>ED</code>, <code>EE</code>, <code>EF</code> || <code>POS(</code>, <code>LEN(</code>, <code>NUM(</code>, <code>VAL(</code> — без закрывающей скобки || подтверждено
| <code>EC</code>, <code>ED</code>, <code>EE</code>, <code>EF</code> || <code>POS(</code>, <code>LEN(</code>, <code>NUM(</code>, <code>VAL(</code> — без закрывающей скобки || подтверждено
|-
|-
| <code>F0</code> || математическая функция, имя не установлено || выведено из данных
| <code>F0</code> || <code>FN&lt;имя&gt;(</code> — обращение к функции пользователя; имя следует сырым кодом символа || подтверждено
|-
|-
| <code>F1</code> || <code>#PI</code> — константа π || подтверждено
| <code>F1</code> || <code>#PI</code> — константа π || подтверждено
Строка 910: Строка 948:
| <code>FE</code> || разделитель записей строк || подтверждено
| <code>FE</code> || разделитель записей строк || подтверждено
|}
|}
=== Два вида строковых литералов ===
Строковые константы кодируются двумя разными токенами, и разницу между ними книга<ref name="balasanyan" /> объясняет прямым текстом: строки в кавычках система распознаёт и выводит как строки из '''прописных''' букв, а строки в апострофах — как строки из '''строчных'''. Так на машине, у которой на клавиатуре есть только прописные буквы, задаются строчные символьные константы.
{| class="wikitable"
! Токен !! Форма записи !! Регистр
|-
| <code>E3</code> || <code>"…"</code> || прописные
|-
| <code>E4</code> || <code>'…'</code> || строчные
|}
Кодирование одинаковое: <code>&lt;токен&gt; &lt;длина: 1 байт&gt; &lt;длина байт КОИ-8&gt;</code>.
Наблюдения это подтверждают: из 9937 литералов <code>E3</code> в наборе ни один не содержит строчной кириллицы (<code>C0</code>–<code>DF</code>), а из 28 литералов <code>E4</code> строчную содержат пять — остальные состоят из латиницы и знаков, где регистр неразличим. Правило книги «внутри строки не должно быть кавычек или апострофов» тоже видно: единственный литерал набора, содержащий кавычки, записан апострофами.
E4 3D 35 2D DA C1 D0 CF CC CE C5 CE C9 C5 …
PRINT '5-заполнение полей "номер страницы" и "обозначение документа"'
Разборщик, не знающий токена <code>E4</code>, теряет синхронизацию до конца оператора.


=== Математические функции ===
=== Математические функции ===
Строка 921: Строка 980:
* <code>FD</code> — вероятно <code>ARCTAN(</code>: в <code>M3</code> и <code>P3</code> её единственный аргумент всегда отношение (<code>FD 25 DC 26 D0</code>).
* <code>FD</code> — вероятно <code>ARCTAN(</code>: в <code>M3</code> и <code>P3</code> её единственный аргумент всегда отношение (<code>FD 25 DC 26 D0</code>).


На пять оставшихся имён (<code>SIN</code>, <code>COS</code>, <code>TAN</code>, <code>ARCSIN</code>, <code>ARCCOS</code>) приходится ровно пять свободных токенов <code>F0</code>, <code>F9</code>, <code>FA</code>, <code>FB</code>, <code>FC</code>, — но программ, сохранённых одновременно в обоих представлениях и использующих тригонометрию, в исследованном наборе нет, поэтому распределение имён по токенам не установлено.
На пять оставшихся имён (<code>SIN</code>, <code>COS</code>, <code>TAN</code>, <code>ARCSIN</code>, <code>ARCCOS</code>) приходится всего четыре свободных токена — <code>F9</code>, <code>FA</code>, <code>FB</code>, <code>FC</code>; программ, сохранённых одновременно в обоих представлениях и использующих тригонометрию, в исследованном наборе нет, поэтому распределение имён по токенам не установлено.
 
=== Функции пользователя ===
 
Оператор <code>DEFFN &lt;имя&gt;(&lt;формальная переменная&gt;) = &lt;выражение&gt;</code> (глагол <code>5A</code>) определяет функцию, обращение к ней записывается <code>FN&lt;имя&gt;(&lt;выражение&gt;)</code> и кодируется токеном <code>F0</code>:
 
5A &lt;имя&gt; &lt;lo&gt; &lt;hi&gt; &lt;формальная переменная&gt; &lt;выражение&gt;
F0 &lt;имя&gt; &lt;выражение&gt; D0
 
Имя функции — латинская буква либо цифра, и это не индекс переменной: пространства имён разные, одна и та же величина может быть и переменной, и именем функции. Знака равенства в потоке нет: тело следует сразу за байтом формальной переменной. Два байта между именем и формальной переменной — рабочее поле, которое машина заполняет при исполнении; у последнего определения в программе там нули.
 
Разбор подтверждается тем, что в каждом файле байты после <code>F0</code> — ровно те имена, которые этот файл определяет оператором <code>DEFFN</code>, и никакие другие. Пример: <code>5A 48 00 00 2A EB 2A EA F2 2A D0 D0 DC E8 02</code> = <code>DEFFN H(X)=(X+ABS(X))/2</code>.


=== Двузначность токенов старшей половины ===
=== Двузначность токенов старшей половины ===
Строка 1051: Строка 1121:


{{Внимание|1=Эти два байта нельзя разбирать как токены. Именно они выглядели как «неопознанные токены» в конце строк <code>DATA</code>: <code>C0 14</code>, <code>C9 04</code>, <code>FA 0E</code>, <code>CF 0B</code>, <code>E4 2C</code>, <code>F9 2C</code>.}}
{{Внимание|1=Эти два байта нельзя разбирать как токены. Именно они выглядели как «неопознанные токены» в конце строк <code>DATA</code>: <code>C0 14</code>, <code>C9 04</code>, <code>FA 0E</code>, <code>CF 0B</code>, <code>E4 2C</code>, <code>F9 2C</code>.}}
Само тело оператора <code>DATA</code> — список значений '''без разделителей''':
29 1E E8 31 E7 03 34 E8 00 E8 28 E7 03 06 E8 31 … C9 04
      31    334      0    28    306      31
Поэтому внутри <code>DATA</code> токены <code>E5</code>, <code>E6</code> и <code>E7</code> всегда читаются как константы и никогда как <code>OR</code>/<code>AND</code>, хотя и стоят в позиции операции. То же относится к оператору <code>MAT REDIM</code>, где длина элемента идёт сразу за закрывающей скобкой:
06 02 0A E0 04 EB E7 01 26 D0 E7 01 28        MAT REDIM A¤(126)128


=== Подпрограммы с параметрами ===
=== Подпрограммы с параметрами ===
Строка 1058: Строка 1137:
  23 0B 05 E8 01 DE E8 01 DE 0D E9 E8 02
  23 0B 05 E8 01 DE E8 01 DE 0D E9 E8 02


Объявление <code>DEFFN'</code> содержит метку, четыре нулевых байта и индексы формальных параметров. Нули, по-видимому, отведены под адрес возврата, заполняемый при выполнении. Объявление <code>DEFFN ' 5(N1,D1,D2)</code> даёт:
Объявление <code>DEFFN'</code> содержит метку, четыре байта адреса входа и индексы формальных параметров. Формальные параметры, в отличие от фактических, идут '''подряд, без разделителей'''. Объявление <code>DEFFN ' 5(N1,D1,D2)</code> даёт:


  27 08 05 00 00 00 00 12 20 21
  27 08 05 00 00 00 00 12 20 21
Четыре байта после метки заполняются интерпретатором при первом обращении к подпрограмме, поэтому нулевыми они бывают только там, где подпрограмму ни разу не звали. В приведённом примере из <code>STAT05</code> они нулевые, а в <code>EDITOR</code> — осмысленные адреса:
27 08 64 68 02 11 14 4F 50 51            EDITOR 400,  DEFFN ' 100(L1,L4,L3)
27 06 4D 00 00 00 00 3D                  EDITOR 7740, DEFFN ' 77(D)
При разборе эти четыре байта следует пропускать, не пытаясь читать как токены.
Тот же вид имеет и <code>3A</code> — определение клавиши специальных функций, но за адресом у него стоит ровно один литерал: в кавычках (<code>E3</code>), в апострофах (<code>E4</code>) или шестнадцатеричный (<code>E2</code>). Последний случай встречается в <code>SCOPE</code>:
3A 08 1F 00 00 A4 03 E2 01 0D            DEFFN ' 31 HEX(0D)
Подпрограммой такая метка не является: <code>3A</code> задаёт текст, подставляемый при нажатии клавиши, и <code>GOSUB'</code> на неё не переходит.


Оператор <code>ON … GOTO</code> кодируется как индекс переменной, токен <code>CD</code> и номера строк по два байта BCD подряд без разделителей.
Оператор <code>ON … GOTO</code> кодируется как индекс переменной, токен <code>CD</code> и номера строк по два байта BCD подряд без разделителей.
=== Неявные функции и уровни скобок ===
Функции <code>POS(</code>, <code>LEN(</code>, <code>NUM(</code>, <code>VAL(</code> и <code>AT(</code> закрывающей скобки в потоке не имеют: они заканчиваются на первом же знаке операции. Важно, что «своего» уровня — закрывающая скобка <code>D0</code>, принадлежащая вложенной явной скобке, такую функцию не закрывает.
EDITOR, строка 265:
EC  E1  E0 2A  E8 01  D0  D7  DE 20  D5  E8 00  D3 02 70
POS(STR( V¤()  , 1    )  &lt;  20    )  &lt;&gt;  0  THEN 270
Здесь <code>D0</code> закрывает только <code>STR(</code>; <code>POS(</code> остаётся открытой и заканчивается на <code>D5</code>. Разборщик, считающий неявные скобки одним счётчиком, выдаст <code>POS(STR(V¤(),1))&lt;20&lt;&gt;0</code> — с потерей смысла. Правильная модель — стек: на каждую явную скобку (включая список индексов массива) заводится уровень, неявные функции считаются внутри текущего уровня, а <code>D0</code> закрывает сначала неявные функции своего уровня, затем сам уровень.
=== Что не кодируется и восстанавливается по форме оператора ===
Часть знаков препинания в потоке отсутствует: их положение определяется синтаксисом конкретного оператора, а не токенами.
{| class="wikitable"
! Оператор !! В потоке !! В листинге
|-
| <code>INIT</code> || <code>64 04 E3 01 2D 15</code> || <code>INIT ("-")U¤</code> — значение в скобках, запятой нет
|-
| <code>CONVERT</code> || <code>47 0F 48 D1 E1 … D0 E3 02 «##»</code> || <code>CONVERT P% TO STR(…),(##)</code> — образ в скобках
|-
| <code>¤GIO</code> с адресом || <code>40 0D DC DE 34 DE E2 06 … 22</code> || <code>¤GIO /34,(HEX(…),A¤)</code>
|-
| <code>¤GIO</code> с апострофом || <code>40 … D5 E2 … 07 …</code> || <code>¤GIO 'HEX(…),D¤(2)</code> — здесь скобок нет
|-
| <code>VERIFY</code> || <code>83 … 02 DB 39 E8 01 D0 DE 16 … 17 …</code> || <code>VERIFY T#D%(1),(X(1),Y(1))</code>
|-
| <code>¤TRAN(</code> || <code>06 0C 06 0D DE 12 D0 DE 00</code> || <code>¤TRAN(Q¤,L0¤)R</code> — запятая после <code>)</code> не печатается
|-
| <code>LABEL</code> || <code>06 1E 0A E0 1F E8 03 DE DE DE E3 01 51</code> || <code>LABEL B¤()3,,,"Q"</code>
|-
| <code>MAT</code> || <code>06 01 04 E0 54 D9 EF</code> || <code>MAT C%=ZER</code> — имя массива без <code>()</code>
|-
| <code>RESTORE</code> || <code>51 05 E8 01 DE 48 50</code> || <code>RESTORE 1,4850</code> — номер строки сырым BCD
|-
| <code>SAVE</code>, <code>LOAD</code> || <code>2A 0A DD 10 52 15 DE 52 15 DE 52 25</code> || <code>SAVE Z¤5215,5215,5225</code> — диапазон строк сырым BCD
|-
| <code>INPUT</code>, <code>LINPUT</code> || <code>06 24 2C E3 28 … E9 32</code> || <code>LINPUT "…",-L¤</code> — запятая перед унарным минусом неявная
|}
{{Внимание|1=Ссылка на массив целиком (<code>E0 &lt;индекс&gt;</code>) — '''законченное значение''': после неё разбор ожидает операцию или следующий элемент списка, а не индекс. В операторах, операнды которых представляют собой список значений (<code>INPUT</code>, <code>READ</code>, <code>LINPUT</code>, <code>INIT</code>, <code>¤GIO</code>, <code>DATA LOAD</code>/<code>SAVE</code>, <code>LIMITS</code>, <code>MAT READ</code>, <code>MAT INPUT</code>), возведения в степень быть не может, поэтому <code>E0</code> там всегда ссылка на массив. Иначе строка <code>DATA LOAD DA T#D%(D),(X(D))D¤,N¤(),T¤(),L¤(),B(D)</code> читается как <code>…D¤^N¤()^T¤()…</code>.}}
=== Операторы, у которых закрывающая скобка не кодируется ===
У глаголов, имя которых оканчивается на <code>(</code>, закрывающей скобки в потоке нет:
{| class="wikitable"
! Глагол !! Форма !! Где находится закрывающая скобка
|-
| <code>43</code> AND(, <code>61</code> OR(, <code>62</code> XOR( || <code>AND(A¤,B¤)</code> || в конце операторной части
|-
| <code>48</code> PACK(, <code>5D</code> UNPACK(, <code>06 0C</code> <code>¤TRAN(</code> || <code>PACK(&lt;формат&gt;)…</code> || сразу за литералом формата
|-
| <code>4B</code> BIN( || <code>BIN(&lt;приёмник&gt;[,2])=&lt;выражение&gt;</code> || после приёмника, вместе со знаком <code>=</code>
|}
4B 02 22 3B                                  BIN(A¤)=J%
4B … E1 23 36 D0 E8 13 DE E8 02 D0 DE DB EF … BIN(STR(A¤(I),13,2),2)=VAL(…)
Пара <code>DE DB</code> здесь означает «,2» — так же, как во втором аргументе функции <code>VAL(</code>. Смысл этого аргумента даёт руководство<ref name="balasanyan" />: <code>VAL(</code> «преобразует двоичное значение содержимого первого байта или первых двух байтов» символьной переменной, то есть аргумент задаёт число байт, и грамматика допускает единственное значение 2. Отсюда и отдельный токен вместо константы: <code>DB</code> в этой позиции и означает двойку, операндов у него нет. Порядок байт — старший первым, по приведённому в руководстве тождеству <code>VAL(X¤,2) = VAL(X¤)*256 + VAL(STR(X¤,2))</code>.


=== Индексация массивов ===
=== Индексация массивов ===
Строка 1112: Строка 1265:
# Прочитать запись каталога: первый и последний сектор, тип должен быть <code>80</code>.
# Прочитать запись каталога: первый и последний сектор, тип должен быть <code>80</code>.
# Прочитать первый сектор: проверить байт 0 = <code>01</code>, взять имя, прочитать байт 9.
# Прочитать первый сектор: проверить байт 0 = <code>01</code>, взять имя, прочитать байт 9.
# Проверить наличие четырёхбайтового поля перед программой: если по смещению <code>6 + L1 + L2 + L3</code> корректной записи строки нет, а по смещению на четыре больше есть — сдвинуть начало.
# Если байт 9 = <code>20</code>: склеить содержимое секторов, разбить по <code>85</code>, отбросить нули, перекодировать КОИ-8. Готово.
# Если байт 9 = <code>20</code>: склеить содержимое секторов, разбить по <code>85</code>, отбросить нули, перекодировать КОИ-8. Готово.
# Если байт 9 = <code>21</code>: собрать поток из секторов с байтом 1 = <code>80</code>, беря с каждого ровно 254 байта '''без обрезки хвостовых нулей'''; прочитать L1, L2, L3; перейти к смещению <code>6 + L1 + L2 + L3</code>.
# Если байт 9 = <code>21</code>: собрать поток из секторов с байтом 1 = <code>80</code>, беря с каждого ровно 254 байта '''без обрезки хвостовых нулей'''; прочитать L1, L2, L3; перейти к смещению <code>6 + L1 + L2 + L3</code>.
Строка 1158: Строка 1312:
== Не установлено ==
== Не установлено ==


# Полная таблица токенов: часть значений в диапазонах 0x31–0x33, 0x37–0x39, 0x3B–0x3E, 0x49, 0x4F, 0x5B, 0x60, 0x65, 0x67, 0x69–0x6C, 0x72, 0x73, 0x7F не занята в известной таблице.
# Полная таблица токенов: часть значений в диапазонах 0x31–0x32, 0x38–0x39, 0x3B–0x3E, 0x49, 0x4F, 0x5B, 0x60, 0x65, 0x67, 0x69–0x6C, 0x73, 0x7F не занята в известной таблице.
# Имя оператора у глаголов <code>37</code> и <code>63</code>, у подкода <code>06 00</code> (вероятно <code>PLOT</code>) и <code>06 1C</code> (вероятно <code>FRAME</code>).
# Имена операторов у глаголов <code>33</code>, <code>37</code>, <code>63</code>, <code>72</code>, у подкодов <code>06 09</code>, <code>06 0D</code>, <code>06 0E</code>, а также у <code>06 00</code> (вероятно <code>PLOT</code>).
# Распределение имён <code>SIN</code>, <code>COS</code>, <code>TAN</code>, <code>ARCSIN</code>, <code>ARCCOS</code> по свободным токенам <code>F0</code>, <code>F9</code>, <code>FA</code>, <code>FB</code>, <code>FC</code>: программ с тригонометрией, сохранённых сразу в обоих представлениях, в наборе нет.
# Распределение имён <code>SIN</code>, <code>COS</code>, <code>TAN</code>, <code>ARCSIN</code>, <code>ARCCOS</code> по свободным токенам <code>F9</code>, <code>FA</code>, <code>FB</code>, <code>FC</code>: программ с тригонометрией, сохранённых сразу в обоих представлениях, в наборе нет.
# Назначение четырёхбайтового поля <code>0A 19 &lt;BCD&gt;</code> перед программой.
# Смысл поля по смещению 4–5 записи таблицы 1 у скалярных символьных переменных: у массивов там число элементов, у скаляров значения образуют ряд с шагом около 6 в порядке объявления независимо от длин, что указывает скорее на указатель, чем на характеристику самой переменной.
# Смысл поля по смещению 4–5 записи таблицы 1 у скалярных символьных переменных: у массивов там число элементов, у скаляров значения образуют ряд с шагом около 6 в порядке объявления независимо от длин, что указывает скорее на указатель, чем на характеристику самой переменной.
# Смысл байта 3 записей таблиц 2 и 3, а также битов 7 и 3 флага.
# Смысл байта 3 записей таблиц 2 и 3, а также битов 7 и 3 флага.
# Смысл поля 0–1 записей таблиц 2 и 3 у переменных, имеющих дескриптор в таблице 1: это не адрес, а небольшое число, растущее примерно на восемь.
# Смысл поля 0–1 записей таблиц 2 и 3 у переменных, имеющих дескриптор в таблице 1: это не адрес, а небольшое число, растущее примерно на восемь.
# Что кодирует токен <code>DB</code> как второй аргумент функции <code>VAL</code>: во всём наборе встречается только <code>VAL(x,2)</code>.
# Однобайтовый операнд у <code>AND(</code>, <code>OR(</code>, <code>XOR(</code>: <code>43 03 15 DE F0</code> = <code>AND(A¤,F0)</code>, <code>61 06 00 E8 01 D0 DE FF</code> = <code>OR(A¤(1),FF)</code>. Похоже на шестнадцатеричную маску без <code>HEX()</code>, но правило, по которому она отличается от ссылки на переменную, неизвестно.
# Однобайтовый операнд у <code>AND(</code>, <code>OR(</code>, <code>XOR(</code>: <code>43 03 15 DE F0</code> = <code>AND(A¤,F0)</code>, <code>61 06 00 E8 01 D0 DE FF</code> = <code>OR(A¤(1),FF)</code>. Похоже на шестнадцатеричную маску без <code>HEX()</code>, но правило, по которому она отличается от ссылки на переменную, неизвестно.
# Причина различия разметки секторов между токенизированными и текстовыми потоками: в текстовых файлах наблюдается позиционная схема <code>02</code>/<code>8F</code>/<code>03</code>, в токенизированных все секторы программы идут с маркером <code>02</code>.
# Причина различия разметки секторов между токенизированными и текстовыми потоками: в текстовых файлах наблюдается позиционная схема <code>02</code>/<code>8F</code>/<code>03</code>, в токенизированных все секторы программы идут с маркером <code>02</code>.
Строка 1172: Строка 1326:


<references>
<references>
<ref name="balasanyan">Баласанян В. Э., Богдюкевич С. В., Шахвердов В. А. Программирование на микроЭВМ «Искра 226». — М.: Финансы и статистика, 1987. — 264 с.: ил. — разделы 5.1, 5.2, 11.5, 18.1, 18.4, 18.7.</ref>
<ref name="balasanyan">Баласанян В. Э., Богдюкевич С. В., Шахвердов В. А. Программирование на микроЭВМ «Искра 226». — М.: Финансы и статистика, 1987. — 264 с.: ил. — разделы 5.1, 5.2, 11.5, 14.2, 18.1, 18.4, 18.7.</ref>
<ref name="vtoraya">Аладьев В. З. и др. Персональный компьютер «Искра-226». Архитектура и программное обеспечение: справочное руководство. — Киев, 1988. — структура программного файла и файла данных, значения признака защиты.</ref>
<ref name="vtoraya">Аладьев В. З. и др. Персональный компьютер «Искра-226». Архитектура и программное обеспечение: справочное руководство. — Киев, 1988. — структура программного файла и файла данных, значения признака защиты.</ref>
</references>
</references>

Версия от 11:04, 26 августа 2026

Этот документ создан для Emuverse и распространяется на условиях лицензии CC-BY-SA-3.0.

Формат файлов BASIC 02 — способ хранения программ на дисках Искра-226. Файловая система унаследована от Wang 2200, представление программы — оригинальное и с Wang несовместимо.

Программа может храниться в двух видах: текстовом (плоский текст в КОИ-8) и токенизированном. Оба вида имеют одинаковую внешнюю структуру и различаются одним байтом в заголовочном секторе.

Общее устройство

На диске располагаются физические сектора размером 128 байт — 77 дорожек, 26 секторов на дорожке, одна сторона. Физические сектора попарно объединены в логические размером 256 байт со сквозной нумерацией. Далее везде будут подразумеваться логические сектора.

Файлу выделяется непрерывный диапазон секторов, границы которого записаны в «Указателе каталога». Раскладка внутри диапазона:

Сектор Содержимое
первый заголовок файла
следующие N поток содержимого
резерв, заполнен нулями
последний выделенный control record

Таким образом, любой файл занимает на диске как минимум на 512 байт больше, чем размер его полезных данных.

Размер файла на диске уменьшать нельзя, поэтому при перезаписи файла более коротким содержимым старые данные в хвосте не затираются. Там могут остаться читаемые фрагменты предыдущих версий файла, иногда в другом представлении. Их нельзя принимать за часть текущего файла, поэтому необходимо завершать обработку файла при нахождении первой control record.

Искра-226 поддерживает работу с двумя типами файлов: ПФ — «Программные файлы» и ФД — «Файлы данных». Программные файлы всегда содержат программу на Бейсике, в текстовом или упакованном токенизированном виде. Файлы данных, соответственно, данные, доступные из программ пользователя.

В соответствии с документацией, Искра-226 поддерживает прямой доступ программ к секторам диска, при этом к записанным таким образом дискам всё нижеизложенное может быть неприменимо, так как форматом хранения полностью управляет программа пользователя по своему усмотрению.

Также, в наличии имеется несколько системных дисков, на которых содержатся различные версии интерпретатора Бейсика, с которых производится начальная загрузка компьютера. Эти диски имеют свой формат и здесь не рассматриваются.

Указатель каталога

Начиная с 0 сектора на диске располагается «Указатель каталога».

Первые 16 байт содержат служебную информацию в следующем составе:

Смещение Размер Значение
0-1 2 размер Указателя каталога в секторах, 16 бит big-endian
2-3 2 номер последнего использованного сектора, 16 бит big-endian
4–5 2 размер тома (обычно 1000), 16 бит big-endian
6–15 10 нули

После служебной информации идут 16-байтовые записи каталога, описывающие файлы. По непонятной причине записи каталога не сгруппированы в начале указателя, а распределены по всем его секторам. Неиспользованные записи заполнены нулями. Следовательно, для чтения указателя каталога необходимо пройти все его сектора, игнорируя нулевые строки.

Запись каталога

16 байт, побайтово совпадает с Wang 2200.

Смещение Размер Значение
0 1 статус: 10 — активна, 11 — удалена (scratched), 00 — свободна
1 1 тип файла: 80 — программа, 00 — данные
2–3 2 первый сектор файла, старший байт первым
4–5 2 последний сектор файла, старший байт первым
6–7 2 не используются
8–15 8 имя файла, дополнено пробелами справа

Байт типа не различает текстовое и токенизированное представление: у обоих 80.

Указатель каталога всегда начинается с нулевого сектора диска; за ним идёт область каталога. Число секторов указателя задаётся при создании каталога оператором SCRATCH DISK параметром LS=, по умолчанию равно 24 и в дальнейшем не меняется; допустимы значения от 1 до 255. В нулевом секторе помещается до 15 записей, в остальных — до 16: первые 16 байт нулевого сектора занимает блок параметров диска.

Оператор LIST DC выводит типы файлов как P (программный), D (файл данных), SP и SD (вычеркнутые из каталога программный и файл данных соответственно), что соответствует сочетанию байта статуса и байта типа в записи.[1]

Пример

 0  1  2  3  4  5  6  7  8  9  A  B  C  D  E  F
10 80 00 31 00 3F 00 00 44 49 47 20 44 45 4D 20
└───┘ └───┘ └───┘       └─────────────────────┘

Активная запись, программа, секторы 49…63, имя DIG DEM.

Заголовочный сектор

Смещение Значение
0 01
1–8 имя файла, дополнено пробелами
9 признак формата записи, см. ниже
10–255 нули

Байт 9 — единственный признак, по которому различаются два представления программы. В исследованном наборе наблюдались значения 20 (текстовое), 21 (токенизированное) и 25 (токенизированное и защищённое).

Связь с параметрами оператора SAVE DC

Документация[1] описывает три параметра специальных форматов записи программы:

Параметр Действие
T программа записывается в оттранслированной форме — во внутреннем формате машины, что сокращает занимаемое место и время загрузки
P программа защищается от просмотра и записи; после загрузки возможно только выполнение, режим сохраняется до оператора CLEAR
G оттранслированная и защищённая форма одновременно

Отсюда следует, что текстовое представление — это режим по умолчанию, а токенизированное включается явным указанием параметра T. Термин «оттранслированная форма» в документации обозначает именно токенизированную запись.

Документированные значения байта 9 (в источнике он назван «признак защиты»):[2]

Значение Символ Защита Представление
20 пробел нет текстовое
21 ! нет оттранслированное
24 ¤ есть текстовое
25 % есть оттранслированное

Таким образом байт 9 — битовое поле: бит 0 — программа оттранслирована (параметр T), бит 2 — программа защищена (параметр P); сочетание обоих соответствует параметру G. Значения 22 и 23 не используются.

Значения 20, 21 и 25 наблюдались на дисковых образах (25 — у файла STAT05, защищённого и оттранслированного одновременно), 24 взято из документации.

Секторы потока

Первые два байта каждого сектора потока — служебные, в содержимое не входят.

Байт 0 — позиция сектора:

Значение Смысл
02 первый сектор потока
8F промежуточный
03 последний

В токенизированных программах все секторы потока наблюдались с маркером 02; позиционная разметка 02/8F/03 подтверждена на текстовых файлах и на потоке значений переменных. Причина различия не установлена.

Байт 1 — только у программных секторов. Во всех исследованных потоках программы он равен 80.


Внимание

У секторов данных служебный заголовок занимает один байт, а не два. То, что во всех наблюдавшихся секторах данных на позиции 1 стоял 00, объясняется не разметкой потока, а тем, что это первый байт двухбайтового идентификатора значения, и 00 в нём означает числовой тип. Для сектора, начинающегося со строкового значения, значение будет другим. Использовать байт 1 как признак «программа или данные» нельзя; надёжный признак — байт 9 заголовочного сектора и байт типа в записи каталога.

Двухбайтовая длина служебного заголовка программных секторов подтверждается арифметикой: длины записей строк сходятся только при пропуске двух байтов на каждой пересекаемой границе сектора.

В токенизированном файле сначала идут секторы программы, за ними могут следовать секторы значений переменных с собственной нумерацией.

Маркер 03 имеет содержательный смысл: документация[1] описывает файл как область, в которой между последней записью данных и последним сектором файла остаются неиспользованные секторы, а концевая запись помечает сектор, откуда можно продолжать запись. Таким образом 03 — не просто «последний по счёту сектор», а граница записанной области, и всё, что лежит за ней до конца выделенного диапазона, к текущему содержимому файла не относится.

Control record

Лежит в последнем выделенном секторе, а не сразу за содержимым.

1C <длина: 2 байта, старший первым>

Остаток сектора — нули. Маркер 1C соответствует по роли байту 20 в Wang. Второй источник[2] описывает эту структуру как признак конца файла 1C, за которым во втором и третьем байтах сектора записано число реально занятых секторов, а остальные байты нулевые; последний сектор файла данных устроен так же, как последний сектор программного файла.

Документация[1] отдельно указывает, что последний сектор файла отводится под служебную информацию, а концевая запись занимает ещё один сектор, поэтому при создании файла его размер следует заказывать на два сектора больше, чем требуется собственно под данные.

Счётчик соответствует графе «Использовано», которую показывает оператор LIST DC. Согласно документации[1] он не поддерживается системой автоматически: значение заносит прикладная программа оператором DATA SAVE DC END, записывающим односекторную концевую запись в текущий сектор из таблицы устройств. Если признак конца данных не записан, в графе «Использовано» всегда стоит 00001; если записан — число реально использованных секторов.

Там, где значение выставлено, оно равно заголовок + секторы содержимого + сам control record, то есть совпадает с правилом Wang:

Файл Секторов содержимого Счётчик Ожидаемо
ФС 5 7 1+5+1 = 7
ДЕМ6 16 18 1+16+1 = 18


Внимание

Счётчик не является инвариантом файловой системы и при разборе ненадёжен. У #СТАТИСТ он равен 48 при 46 секторах содержимого — значение, по-видимому, осталось от предыдущей, более длинной версии программы, остатки которой лежат в резерве того же файла. У DIG DEM счётчик равен 6 при 5 секторах содержимого, то есть на единицу меньше ожидаемого; возможная причина в том, что там последней операцией была запись потока данных, а не программы. Границы файла следует брать из каталога, а конец данных определять по структуре записей.

Текстовое представление

Программа хранится плоским текстом. Кодировка — КОИ-8 (ГОСТ 19768-74): прописная кириллица в 0xE0–0xFF, строчная в 0xC0–0xDF. Номера строк записаны обычными ASCII-цифрами.

  • Разделитель строк — байт 85.
  • Строка не пересекает границу сектора; хвост сектора заполняется нулями.
  • Байт 24 ($) отображается на экране Искры как ¤.

Выбор 85 возможен именно потому, что кириллица занимает только верхнюю четверть кодовой таблицы и диапазон 0x80–0x9F остаётся свободным. К самой кодировке КОИ-8 это соглашение отношения не имеет и за пределами Искры не встречается.

Разбор: склеить содержимое секторов, отбрасывая по два служебных байта, разбить по 85, отбросить нули.

Пример

02 80 35 20 52 45 4D 20 F0 E5 F4 F2 E5 EE EB EF … 85 38 20 50 52 49 4E 54 …

Заголовок сектора, затем 5 REM ПЕТРЕНКО …, разделитель, 8 PRINT ….

Токенизированное представление

Сборка потока

Склеить содержимое секторов с байтом 1 равным 80, отбрасывая по два служебных байта у каждого. Далее смещения даны от начала полученного потока.

Пролог и таблицы

Поток начинается с трёх 16-битных длин, старший байт первым, за которыми следуют три таблицы:

Смещение Размер Значение
0 2 L1 — длина таблицы 1 в байтах, запись 8 байт
2 2 L2 — длина таблицы 2 в байтах, запись 4 байта
4 2 L3 — длина таблицы 3 в байтах, запись 4 байта
6 L1 таблица 1
6+L1 L2 таблица 2
6+L1+L2 L3 таблица 3

Программа начинается по смещению 6 + L1 + L2 + L3.

Проверено на четырёх файлах:

Файл L1 L2 L3 Старт Первая строка
DIG DEM 24 20 0 50 0 GOTO 10
#СТАТИСТ 216 488 108 818 999 REM КОНЕЦ
ДЕМ6 392 256 0 654 10 REM "ДЕМ6". ГОРОСКОП
EDITOR 448 800 0 1254 10 % EDITOR. ВЕРСИЯ 4.1

Формула даёт точную границу, эвристический поиск начала программы не требуется.

Четырёхбайтовое поле перед программой

У части файлов между таблицами и первой записью строки лежат четыре лишних байта, и формула указывает на четыре байта раньше настоящего начала программы. В исследованном наборе так устроены 19 файлов из 94 — целиком одно семейство программ. Первые два байта поля всегда 0A 19, вторые два — двоично-десятичное число, своё у каждого файла:

Файл Поле Файл Поле
BAM 0A 19 20 20 BAM00 0A 19 90 90
BAM1 0A 19 20 91 BAM9 0A 19 20 99
BAM10 0A 19 91 90 S_BAM01 0A 19 90 91

Признак защиты роли не играет: девять других файлов набора со значением байта 9, равным 25, поля не имеют. Назначение поля не установлено; ни на запись строки, ни на запись таблицы 2 оно не раскладывается.

Определять наличие поля следует проверкой самой записи: по вычисленному смещению (после пропуска нулей выравнивания) оба байта номера строки должны быть правильным двоично-десятичным числом, байт длины — не меньше единицы, а байт по адресу p + 2 + len — равен FE. Если проверка не проходит, а по смещению +4 проходит, поле присутствует. На наборе это разделяет файлы без единой ошибки.


Внимание

Полагаться на «разбор сломается — попробуем сдвиг» нельзя. У файла BAM1 мусорная запись по неверному смещению случайно оканчивалась байтом FE: разбор продолжался дальше и терял только первую строку программы.

Таблица 1

Таблица 1 описывает переменные, которым нужен дескриптор размера — массивы и символьные переменные с явно заданной длиной. Оператор объявления при этом не важен: в таблицу попадают как переменные из DIM, так и из COM (аналог DIM для переменных, общих для нескольких программ). Числовые скаляры и символьные переменные с длиной по умолчанию в таблице 1 не описываются.

В файле М1.Х записей 13 при 10 переменных в DIM; лишние три — C(14), G(14) и N0¤21, объявленные в COM.

Запись — 8 байт:

Смещение Размер Значение
0–1 2 адрес переменной в памяти, младший байт первым
2–3 2 тип: 00 08 — символьная, 2D 08 — числовая или целая
4–5 2 для массивов — число элементов, младший байт первым
6–7 2 размерный код, младший байт первым

Размерный код равен 2 × размер элемента, а его младший бит означает, что длина была задана явно. Для числовых переменных код 16 (размер элемента 8 байт), для целых 4 (2 байта), для символьных 2 × длина + 1: длина 8 → 17, 64 → 129, 128 → 257, 253 → 507.

Символьная переменная, объявленная без указания длины, получает длину по умолчанию 16 и чётный код 32. В STAT01A так объявлены B6¤(400) и B7¤(10), у обоих код 32, тогда как у всех переменных с явной длиной в том же файле код нечётный и точен. Поэтому нечётность кода нельзя использовать как признак символьного типа — для этого служат байты 2–3.

Двумерные массивы

У двумерного массива вторая размерность записывается в байты 2–3, на место признака типа, а первая остаётся в поле числа элементов. Размерности не перемножаются, поэтому оператор DIM восстанавливается точно.

Правило проверено на десяти массивах в четырёх файлах, включая A(5,6) из STAT03 с двумя разными малыми размерностями. В М1.Х пять массивов вида (2,99) дают в байтах 2–3 значение 99, а в поле числа элементов 2; контрольный R(2,2) с равными размерностями даёт 2 и 2. Размер выделяемой памяти считается по общей формуле с перемножением размерностей: у P(2,99) разность адресов равна 1590 = 2 × 99 × 8 + 6, у R(2,2) — 38 = 2 × 2 × 8 + 6.

Пример записи Q(7,8) из STAT01A:

00 00  08 00  07 00  10 00

Байты 2–3 равны 8 (вторая размерность), байты 4–5 равны 7 (первая), размерный код 16 — числовая. Опознание надёжно: соседние записи таблицы содержат 13 и 8 элементов, а в тексте DIM вокруг Q(7,8) стоят A(13) и E(8).

Практическое правило: старший байт поля 2–3 равен 08 — массив одномерный, иначе поле 2–3 целиком занято второй размерностью. Значения 08 2D и 08 00 не могут быть размерностью, так как означали бы 2093 и 2048 элементов по второму измерению.

Вопрос «как при двумерности кодируется тип переменной» снимается: тип хранится не в таблице 1, а во флаге записи таблиц 2 и 3 (см. ниже), поэтому байты 2–3 таблицы 1 свободны под размерность. Символьные двумерные массивы в наборе есть — пятнадцать записей, у которых флаг помечает символьный тип, а старший байт поля 2–3 равен 0C.


Внимание

Исключение — неявно объявленные массивы. У переменной, к которой обратились с индексом без предварительного DIM, число элементов всегда равно 10 (размерность массива по умолчанию), а в байтах 2–3 стоят значения 01 27 или 07 59, размерностями не являющиеся: в исследованном наборе они встречаются девять и семь раз соответственно и только при десяти элементах, в неродственных программах. Их природа не установлена. Такие массивы следует выводить как одномерные (10). Настоящий двумерный массив (10,10) в наборе тоже есть — в STATIST, там байты 2–3 равны 00 0A.

Порядок записей обратен порядку объявления

Память под переменные выделяется сверху вниз, от верхней границы, а записи в таблице отсортированы по возрастанию адреса. Поэтому первая переменная в DIM оказывается последней записью таблицы, и сопоставлять их нужно с конца.

Проверено на файле EDITOR: 7 операторов DIM объявляют 50 переменных, L1 = 448 = 56 записей. При обратном сопоставлении разность адресов соседних записей совпадает с ожидаемым размером переменной у 44 из 50 точно, а оставшиеся 6 расходятся ровно на 1 байт — это нечётные длины (A¤1, K¤253, G¤19), округляемые вверх до чётной.


Внимание

Адреса в таблице 1 могут быть нулевыми. В файле STAT05 все 11 записей имеют адрес 0000, поэтому любое правило, опирающееся на разность адресов соседних записей, там неприменимо. Разборщику следует проверять адреса на ненулевое значение перед использованием.

Остальные поля при этом заполнены и корректны: обратный порядок относительно DIM сохраняется, размерный код точен для всех строковых переменных, у массива K(9) число элементов равно 9.

Размер выделяемой памяти:

  • скалярная символьная переменная — объявленная длина, округлённая вверх до чётной;
  • массив — N × размер элемента + 6, где 6 байт занимает дескриптор.

Формула для массивов проверена на 20 массивах EDITOR без единого расхождения: V¤(20)64 → 1286, S¤(48)64 → 3078, P%(300) → 606, X(2) → 22.

Таблица отражает состояние на момент сохранения

Число записей может превышать число переменных в DIM. В STAT01A записей 26 при 23 объявленных переменных, и три лишние стоят в области самых низких адресов, то есть выделены последними.

Число элементов у лишних записей соответствует не тексту программы, а значению, которое переменная получила при выполнении: в STAT01A у всех трёх лишних записей это 300, тогда как в DIM объявлено 200. Программа содержит оператор MAT REDIM, переопределяющий размерности во время работы, поэтому таблица описывает состояние памяти на момент сохранения, а не исходный текст.

Косвенное подтверждение: в токенах DIM файла STAT01A переменные X, Y и получили индексы 40, 41, 42, тогда как все остальные — обычные значения подряд.

Причина этого выяснена на файле STAT03, сохранённом в обоих представлениях. Выросший массив получает не только новый дескриптор в таблице 1, но и новый индекс переменной, причём интерпретатор правит операнд в самом операторе DIM, оставляя код и MAT REDIM работать со старым индексом. Оператор

20 DIM X(100),G¤(100)5,Q(5,100),D(6),E(5),A(5,6)

кодируется как

46 06 19 1A 1B 03 04 05

— первые три переменные записаны индексами 19, 1A, 1B, тогда как MAT REDIM в строке 200 обращается к ним же как E0 00, E0 01, E0 02. В таблицах 2 и 3 бит 0 флага установлен и у 19, 1A, 1B, и у 00, 01, 02: первым соответствуют дескрипторы с 300 элементами (размер после переопределения), вторым — исходные, со 100.


Внимание

Из этого следует, что операторы DIM в оттранслированном файле нельзя использовать как источник соответствия «индекс — дескриптор»: там могут стоять «теневые» индексы. Надёжный источник — бит 0 флага записей таблиц 2 и 3.

Дополнительный дескриптор создаётся только тогда, когда массив вырастает за пределы исходного выделения. Если новый размер не превышает объявленного в DIM, память переиспользуется на месте и запись в таблице остаётся одна.

Наиболее наглядно это видно в STAT03, где MAT REDIM переопределяет шесть массивов, а лишних записей три:

Массив Объявлено После переопределения Дескриптор
X(100) 100 300 добавлен
G¤(100)5 100 300 добавлен
Q(5,100) 100 300 добавлен
D(6) 6 не больше 6 нет
E(5) 5 не больше 5 нет
A(5,6) 5, 6 не больше 5 и 6 нет

Правило согласуется и с остальными файлами: в STAT01A из одиннадцати переопределяемых массивов выросли три, в STAT00 из четырёх — два, и столько же лишних записей в каждом случае.

Если программа не выполнялась после загрузки, оператор MAT REDIM не отрабатывает и лишних записей нет вовсе: в STAT08 записей ровно шесть при шести переменных в DIM.

В EDITOR шесть записей таблицы 1 не соответствуют ни одному DIM. По флагам таблицы 2 они принадлежат переменным с индексами 39, 54, 64, 90, 92, 93, причём у всех шести число элементов равно 10 — размерности массива по умолчанию. Это неявно объявленные массивы: переменная, к которой обратились с индексом без предварительного DIM, получает десять элементов и полноценный дескриптор. Три из шести — целые (%), размерный код 4, три — действительные, код 16.

Таблицы 2 и 3

Таблицы 2 и 3 образуют один непрерывный массив дескрипторов переменных. Формат записей в обеих одинаков, граница между ними определяется только счётчиками пролога; число записей — L2 / 4 и L3 / 4, поскольку длины в прологе даны в байтах, а запись занимает 4 байта, а не 8.

Смещение Размер Значение
0–1 2 адрес переменной в памяти, младший байт первым; 0000, если память не выделена
2 1 флаг типа
3 1 назначение не установлено
Порядок записей

Записи описывают все переменные программы, а не только скалярные, и идут в порядке убывания индекса переменной. Если обозначить

N = L2 / 4 + L3 / 4

то запись, описывающая переменную с индексом i, находится на позиции N − 1 − i, если считать позиции подряд: сначала записи таблицы 2, затем записи таблицы 3.

Отсюда следует, что N — это общее число переменных программы, то есть наибольший использованный индекс плюс единица. Таблица 3 приходится на самые младшие индексы — именно те, которые занимает оператор COM: он всегда выполняется первым и получает индексы с нуля.

Правило проверено на всех файлах исследованного набора, разбор которых не срывается на бинарных полезных нагрузках операторов ASMB и $GIO: для 28 файлов совпадение точное.

Независимое подтверждение даёт второй набор из 43 файлов, добавленный позже: соотношение «число записей с установленным битом 0 флага равно L1 / 8» (см. ниже) выполняется в нём для всех 43 файлов без исключения.

Флаг типа
Бит Значение
5 (0x20) символьная переменная
4 (0x10) числовая переменная (действительная)
ни 5, ни 4 целая переменная (суффикс %)
0 (0x01) у переменной есть дескриптор в таблице 1 — то есть это массив либо символьная переменная с явно заданной длиной
7, 3 назначение не установлено

Признак целого типа установлен на файле VICT, единственном в наборе, где есть и целые переменные, и обе копии программы. Ровно три записи таблицы 2 имеют флаг & 0x30 = 0 — те, что соответствуют индексам 23, 28 и 33. В текстовом листинге ровно три целых переменных, и их индексы совпадают: E% — строка 98 (E%=036 04 23 D9 E8 00), E7% — строка 1010, E3% — строка 5070. У всех троих адрес равен 0000: целым скалярам в общей области скаляров место не отводится.

Признак символьного типа согласуется с прежним наблюдением: в М1.Х у и N1¤ флаг A8, а адреса этих переменных отстоят от соседних на 16 байт — длина символьной переменной по умолчанию.

Связь с таблицей 1

Число записей с установленным битом 0 флага в точности равно L1 / 8 во всех 94 файлах набора. Более того, соответствие оказывается порядковым: k-я по счёту такая запись (в порядке файла) описывает ту же переменную, что и k-я запись таблицы 1.

k = 0
для pos = 0 … N−1:
    если флаг[pos] и 1:
        дескриптор_переменной(N − 1 − pos) = запись таблицы 1 номер k
        k = k + 1

Это даёт точное соответствие «индекс переменной → запись таблицы 1» без разбора операторов DIM и COM. Прежний способ — сопоставление по порядку объявления — ошибочен по двум причинам:

  • оператор COM объявляет и обычные скаляры, у которых записи в таблице 1 нет: в М1.Х из тринадцати объявленных переменных дескриптор имеют только три (C(14), G(14), N0¤21);
  • после MAT REDIM в операнде DIM могут стоять «теневые» индексы (см. ниже).

Три записи таблицы 3 в М1.Х с низкими значениями поля 0–1 (0014, 000D, 0005) — это как раз те три переменные COM, которые описаны в таблице 1. У всех переменных с дескриптором таблицы 1 поле 0–1 содержит не адрес, а небольшое число, растущее примерно на восемь с каждой такой переменной (в М1.Х — 5, 13, 20, 29, 38, 46, 54, 62, 70, 78, 85, 93, 101). Назначение этого поля не установлено.

Практическое следствие

Хотя имена переменных в оттранслированном файле не сохраняются, для каждой переменной восстанавливаются:

  • тип — действительная, целая (%) или символьная (¤);
  • массив это или скаляр;
  • размерности массива и длина элемента.

Разборщику не нужны ни эвристики «массив или скаляр» по разностям адресов (в защищённых файлах адреса нулевые), ни разбор операторов DIM.

Индексы переменных и их имена

Переменные адресуются в коде однобайтовым индексом. Индексы назначаются в порядке первого появления переменной в тексте программы, а не по алфавиту и не по типу.

Операторы COM и DIM делят единое пространство индексов: в М1.Х оператор COM занимает индексы 000C, а следующий за ним DIM продолжает с 0D.

Для переменных, объявленных в DIM, это даёт прямое соответствие: операторы DIM перечисляют свои переменные подряд, в том же порядке, в каком они записаны в исходном тексте. В EDITOR семь операторов DIM занимают индексы 0132 непрерывно; индекс 00 достался переменной R2%, встретившейся раньше — в строке 30, до первого DIM. В ДЕМ6, где до DIM переменных не было, нумерация начинается с 00.


Внимание

Имена переменных в оттранслированном файле не сохраняются. Таблицы содержат дескрипторы памяти — адрес, тип, размер, — но не имена.

Проверка на EDITOR, где программа сохранена одновременно в текстовом и оттранслированном виде: сопоставление 866 общих строк дало однозначное имя для 146 индексов из 160, и ни одно поле таблиц с этими именами не коррелирует. В таблице 1 поле по смещению 4–5 совпадает у Y¤4 и Z¤253 (72), у D¤8 и Q5¤40 (204); в таблице 2 последний байт записи совпадает у заведомо разных переменных (D% и I%, J% и E).

Это согласуется с назначением параметра T: при выполнении имена не нужны, всё адресуется по индексу, а отказ от их хранения и даёт заявленную экономию места. Практическое следствие — читаемый листинг из оттранслированного файла восстановить нельзя. Восстанавливается структура программы, но переменные остаются безымянными, если не сохранилась текстовая версия того же исходника.

Не хранится только само имя. Тип переменной — действительная, целая или символьная — и её размерности восстанавливаются полностью по таблицам 2, 3 и 1, поэтому в листинге можно выводить корректные суффиксы % и ¤ и корректные размерности массивов.

Записи строк

Программа — последовательность записей, разделённых байтом FE. Перед первой записью разделителя нет.

<номер строки: 2 байта BCD> <len: 1 байт> <тело>

len считается включая сам байт len и до следующего FE. Следующий разделитель находится по адресу адрес(len) + len.

В отличие от текстового представления, записи пересекают границу сектора; два служебных байта нового сектора в длину не входят.

Выравнивание в конце сектора

Если очередная запись не помещается в остаток сектора, остаток заполняется нулями, а запись начинается с первого байта следующего сектора. Такие нули стоят после разделителя FE и в длину записи не входят.

Точное правило формулируется через границы секторов, а не через длину заголовка. Поток рассматривается как последовательность 254-байтовых кусков — по одному на сектор, без обрезки хвостовых нулей. После разделителя FE, стоящего по смещению q:

b = (⌊q / 254⌋ + 1) × 254
если b > q и все байты потока с q по b−1 нулевые, то q = b

То есть переход к следующему сектору выполняется только тогда, когда весь остаток текущего куска нулевой.

С этим правилом разбор всех 51 токенизированного файла исследованного набора проходит без единой рассинхронизации, а EDITOR даёт ровно 1422 записи строк — столько же, сколько строк в его текстовой версии. Эвристика «пропустить до трёх нулей после FE» этого не обеспечивает: длина выравнивания доходит до шести байт.


Внимание

Строка с номером 0 кодируется байтами 00 00 <len> — такая строка есть в файле DIG DEM (0 GOTO 10). Разборщик, безусловно пропускающий пару нулей перед номером строки, разрушает разбор подобных файлов. Нули следует пропускать только по правилу выше.

Операторы

Тело записи — последовательность операторов:

<токен глагола: 1 байт> <len: 1 байт> <операнды: len байт>

Здесь len — длина только операндов, сам байт len не считается. len = 00 означает оператор без операндов, например голый PRINT.

Наличие явной длины у каждого оператора позволяет разрезать программу на операторы, ещё не зная значений токенов. Эта особенность вынужденная: в отличие от Wang, где многословные команды собираются из нескольких токенов вперемешку с обычным ASCII и границы видны по самому потоку, у Искры весь текст программы переведён в токены и поток непрозрачен.

Пример разбора

Строка 2000 файла #СТАТИСТ, длина 0x54 = 84:

20 00 54
23 01 23                          GOSUB ' 35
4C 39 E3 1F «БУДЕТЕ …» DD 00 DD E3 12 «-[1] ИЛИ ДВУМЯ [2]» DD
                                  PRINT "…";F¤;"…";
41 01 5C                          INPUT F%
36 03 5D D9 0E                    N7=N3
24 06 0E D7 11 D3 20 01           IF N3<N6THEN2001
36 03 5D D9 11                    N7=N6

Сумма: 3 + 59 + 3 + 5 + 8 + 5 = 83, плюс байт длины = 84.

Таблица токенов

Глаголы

Основной массив значений восстановлен из прошивки интерпретатора (алфавитный список ключевых слов по смещению 0x1840 и 51-байтовый массив перестановки по 0x19B6). Отмеченные записи проверены или исправлены сопоставлением токенизированной и текстовой версий одной программы.

Токен Оператор Примечание
1E IF END THEN выведено из данных; операнд — 2 байта BCD, номер строки
21 GOTO подтверждено
22 GOSUB подтверждено
23 GOSUB' в прошивочной таблице пропуск; значение выведено из данных
24 IF подтверждено
25 KEYIN подтверждено
26 ON подтверждено
27 DEFFN' подтверждено
28 PRINTUSING в опубликованной таблице ошибочно указан GOSUB'; исправлено по данным
29 DATA подтверждено
2A SAVE
2B RENUMBER
2C CLEAR
2D LOAD
2E LIST
2F RUN подтверждено
30 RETURN CLEAR подтверждено
34 ON ERROR подтверждено
35 LET
36 (присваивание без ключевого слова) подтверждено
33 (не опознан; операнды — две ссылки на переменные) выведено из данных
37 (не опознан; операнд — один массив целиком) выведено из данных
3A DEFFN' с текстовым определением выведено из данных
3F % (краткая форма REM) подтверждено
40 $GIO
41 INPUT подтверждено
42 STOP подтверждено
43 AND( подтверждено
44 READ подтверждено
45 BOOL
46 DIM подтверждено
47 CONVERT подтверждено
48 PACK( подтверждено
4A ADD
4B BIN(
4C PRINT подтверждено
4D ROTATE подтверждено
4E COM подтверждено
50 HEXPRINT
51 RESTORE подтверждено
52 NEXT подтверждено
53 REWIND
54 SELECT подтверждено
55 BACKSPACE
56 REM подтверждено
57 FOR подтверждено
58 SKIP
59 END
5A DEFFN
5C RES
5D UNPACK( подтверждено
5E RETURN подтверждено
5F TRACE
61 OR(
62 XOR(
63 (операция над символьными переменными, имя не установлено) выведено из данных
64 INIT подтверждено
66 DATA LOAD BT подтверждено
68 DATA SAVE BT подтверждено
6D COPY
6E DATA SAVE BA подтверждено
70 DATA LOAD BA подтверждено
71 DATA LOAD DA подтверждено
72 (не опознан; операнды T#n,(…)…, встречается при загрузке сегмента) выведено из данных
74 DATA LOAD DC выведено из данных
75 DATA LOAD DC OPEN T выведено из данных
76 DATA SAVE DC подтверждено
77 DATA SAVE DC CLOSE подтверждено
78 DATA SAVE DC OPEN T подтверждено
79 DBACKSPACE
7A DSKIP
7B LIMITS подтверждено
7C LIST DC подтверждено
7D LOAD DC выведено из данных
7E MOVE
80 SAVE DC выведено из данных
81 SCRATCH
82 SCRATCH DISK подтверждено
83 VERIFY

Пометка «подтверждено» означает сверку с текстовым листингом той же программы. Основная часть подтверждений получена на файле EDITOR автоматическим сопоставлением 866 общих строк: в строках, где число операторов в обоих представлениях совпало, первый глагол каждого оператора сверялся с первым словом соответствующего оператора текста. Так подтверждены 34 значения, включая 21 = GOTO (147 совпадений), 4C = PRINT (212), 24 = IF (266).

Отдельно стоит краткая форма комментария % (токен 3F): она встречается в EDITOR 122 раза против 7 у полного REM (токен 56), и её операнд записывается сырым текстом без префикса E3 — так же, как у REM.

Значения назначены не по алфавиту, а тематическими группами с запасом внутри каждой: управление ходом выполнения в 0x21–0x2F, ввод-вывод около 0x41–0x4C, дисковые операции в 0x74–0x83. Составные дисковые команды получают один токен на всю фразу, тогда как в Wang та же команда собирается из нескольких (DATA + LOAD + DC).

Документация[1] описывает также операторы DATA SAVE DC END, DATA SAVE DC CLOSE и DATA LOAD DC OPEN. Все три найдены: DATA LOAD DC OPEN — токен 75, DATA SAVE DC CLOSE — отдельный токен 77, а DATA SAVE DC END оказался не отдельным глаголом, а обычным DATA SAVE DC (76) с единственным операндом D7 — ключевым словом END.

Операнды дисковых операторов

Первый байт операндов дискового оператора — код устройства или режима, а не ссылка на переменную:

Байт Значение
00 F — первый дисковод
01 R — второй дисковод
02 T — обращение по номеру файла (#n)

Правило проверено на LIST DC F7C 01 00, LIST DC R7C 01 01, LOAD DC F/1C,"М2"7D 08 00 DC DE 1C DE E3 02 ED 32, SCRATCH R"VIC"81 05 01 E3 03 56 49 43, SCRATCH T#D,F1¤81 05 02 DB 22 DE 4C, DATA SAVE DC OPEN T(700)A¤78 07 02 EB E7 07 00 D0 09.

Ключевые слова конца и начала файла кодируются токенами, у которых в позиции операции другое значение:

79 01 D6              DBACKSPACE BEG
7A 01 D7              DSKIP END
76 01 D7              DATA SAVE DC END
79 04 DB E8 01 DE D6  DBACKSPACE #1,BEG

Тот же D6 в операторах DATA SAVE DC и SAVE DC печатается как ¤, а D2 (обычно STEP) — как параметр T:

76 07 D6 DB E8 02 DE E0 12                  DATA SAVE DC ¤#2,W()
80 0E 01 D6 D2 EB E3 03 «VIC» D0 E3 03 «VIC»  SAVE DC R¤T("VIC")"VIC"

Оператор SCRATCH DISK использует ключевые слова LS и END:

82 0B 01 06 D9 E8 05 DE D7 D9 E7 10 00      SCRATCH DISK RLS=5,END=1000
82 0B 00 06 D9 E8 05 DE D7 D9 E7 10 00      SCRATCH DISK FLS=5,END=1000

Здесь 01/00 — дисковод, 06 — ключевое слово LS, D9 — знак равенства, D7END.

Списки переменных и списки выражений

Список принимающих переменных пишется без разделителей — соседние ссылки на переменные и есть список:

41 02 0A 0B                                 INPUT T0,N0
74 03 05 0C 0D                              DATA LOAD DC A1¤,E1,E2
7B 08 02 DB 22 DE 4C 4D 4E 36 4F            LIMITS T#D,F1¤,O,A,Q,R
46 04 00 01 02 03                           DIM X(300),Y(300),N(2),G¤(300)5

Список выражений разделяется DE:

76 06 D6 05 DE 0A DE 0B                     DATA SAVE DC ¤A1¤,T0,N0
28 0B E7 04 70 DE 0F DE 10 DE 00 10 D0      PRINTUSING 470,I,D,X(D)

Запятая между приглашением и переменной в операторе INPUT не кодируется:

41 14 E3 11 «СТЕПЕНЬ  СВОБОДЫ » 00          INPUT "СТЕПЕНЬ  СВОБОДЫ ",K

Номер строки-образа в PRINTUSING — обычная константа E7, а диапазоны строк в SAVE, LOAD и SAVE DC записываются сырым двухбайтовым BCD без токена:

80 … 90 00 DE 90 90                         SAVE DC …"*ASMBBAS" 9000,9090
2A 0A DD 10 52 15 DE 52 15 DE 52 25         SAVE Z¤5215,5215,5225

У оператора BIN( закрывающая скобка и знак равенства не кодируются, как у PACK( и UNPACK(:

4B 02 22 3B                                 BIN(A¤)=J%

Двухбайтовые глаголы

Матричные и графические операторы кодируются двумя байтами: префиксом 06 и подкодом. Длина операторной части следует за подкодом на обычном месте:

06 <подкод> <len> <операнды>

Разборщик, ожидающий однобайтовый глагол, на таких строках теряет синхронизацию.

Подкод Оператор Достоверность
00 PLOT (?) выведено из данных, см. ниже
01 MAT (присваивание) подтверждено
02 MAT REDIM подтверждено
03 MAT READ по контексту: RESTORE 1,X:06 03 02 E0 24
04 MAT INPUT по контексту: приглашение PRINT, затем 06 04 02 E0 32
06 MAT COPY подтверждено
0A MAT SEARCH подтверждено
0C ¤TRAN( подтверждено
09 MAT MOVE (?) выведено из данных: <массив>,<выр.>,<выр.> TO <цель>
0B MAT SORT форма <массив> TO <массив>,<массив> совпадает с MAT SORT B¤()TOQ¤(),L¤() из текстового листинга
0D ¤PACK (?) (<A¤>=<формат¤>) <B¤> FROM <выр.>
0E ¤UNPACK (?) то же с TO
0F ¤OPEN подтверждено
13 DOT сопоставление идиом двух программ
14 DDRAW сопоставление идиом двух программ
15 DRAW подтверждено
19 NPLOT подтверждено
1C STRETCH подтверждено
1E LABEL подтверждено
1F ¤COPY подтверждено
22 ¤LET подтверждено
23 WINDOW подтверждено
24 LINPUT подтверждено
25 ASMB подтверждено
26 REPLACE подтверждено

Операторы DOT и DDRAW опознаны совпадением идиомы в двух программах. Текстовый листинг FAN01:

1540 T3=1:FOR T=2TOT4:NPLOT B6¤(),(M6+M8*(T-T3)),P7+3:DDRAW B6¤(),0,-3:NEXT T
1560 …:DOT B6¤(),R8,R9:DDRAW B6¤(),R6,R7:NEXT T

Токены M4 в тех же конструкциях (рисование засечки на оси и отрезка по приращениям):

06 19 … : 06 14 09 E0 10 DE E8 00 DE E9 E8 03      NPLOT …:DDRAW A(),0,-3
06 13 06 E0 10 DE 2A DE 2B : 06 14 06 E0 10 DE 2C DE 1C

Подкод 00

Операнды состоят из групп, ограниченных D7D4 (то есть <>) и разделённых DE; внутри группы до трёх элементов, тоже через DE. Третий элемент (перо) может отсутствовать, быть выражением, строковым литералом или одним из токенов E5/E6:

06 00 09 D7 E8 00 DE E8 10 DE E6 D4                    <0,16,…>
06 00 … D7 E8 56 DE E7 02 55 DE D4 DE D7 DE 2E E9 E7 02 25 DE E6 D4 …

Такой синтаксис соответствует оператору PLOT системы Wang 2200, где аргументы записываются в угловых скобках. В указателе операторов книги[1] PLOT присутствует только как имя устройства вывода, поэтому имя оператора считается вероятным, но не доказанным.

Примеры из STAT00 и STAT01A:

06 02 19 E0 00 EB 09 D0 DE E0 01 EB 08 D0 DE …   MAT REDIM X(…),Y(…),…
06 01 04 E0 07 D9 EF                             MAT S0=ZER
06 19 08 E0 12 DE 26 DE E7 02 50                 NPLOT B6¤(),C1,250
06 1F 06 DC DE 14 DE E0 12                       ¤COPY /14,B6¤()

В матричном присваивании EF в позиции операнда означает ZER.

В операторе MAT REDIM размерности массива, в отличие от обращения к элементу, заключаются в явную открывающую скобку EB, а между собой разделяются DE. Длина элемента символьного массива указывается после закрывающей скобки:

E0 02 EB 0E DE 0D D0        Q(M1,N)   — двумерный
E0 05 EB 0E DE 0F D0        A(M1,M2)
E0 01 EB 0D D0 E8 05        G¤(N)5    — длина элемента после скобки

Пропущенные параметры

Пропущенный параметр не кодируется ничем: между разделителями DE просто нет операнда. Оператор LABEL B6¤(),,,B3¤(1) с тремя пропущенными параметрами даёт три подряд идущих DE:

06 1E 09 E0 12 DE DE DE 11 E8 01 D0

Операнды

Токен Значение Достоверность
00C9 ссылка на переменную по индексу подтверждено
CA FROM (в PACK/UNPACK) подтверждено
CB ALL (в RETURN CLEAR ALL) подтверждено
CC GOSUB в составе ON … GOSUB подтверждено
CD GOTO в составе ON … GOTO подтверждено
D0 ) вероятно
D1 TO подтверждено
D2 STEP; параметр T в SAVE DC подтверждено
D3 THEN, далее 2 байта BCD — номер строки подтверждено
D4 > подтверждено
D5 <> в позиции операции, AT( в позиции операнда подтверждено
D6 <= в позиции операции; BEG или ¤ в позиции операнда подтверждено
D7 < в позиции операции; END в позиции операнда подтверждено
D8 >= в позиции операции, ROUND( в позиции операнда подтверждено
D9 = подтверждено
DB # подтверждено
DC / вероятно
DD ; подтверждено
DE , подтверждено
DF * в позиции операции, TAB( в позиции операнда подтверждено
E0 ^ в позиции операции, ссылка на массив целиком в позиции операнда подтверждено
E1 функция STR подтверждено
E2 шестнадцатеричный литерал HEX(…): E2 <len> <len байт> подтверждено
E3 строковый литерал в кавычках: E3 <len> <len байт КОИ-8> подтверждено
E4 строковый литерал в апострофах, кодирование то же подтверждено
E5 число с фиксированной точкой, см. ниже подтверждено
E6 число с порядком, см. ниже подтверждено
E7 числовая константа: E7 <2 байта BCD>, диапазон 0–9999 подтверждено
E8 числовая константа: E8 <байт BCD>, диапазон 0–99 подтверждено
E9 -, бинарный или унарный подтверждено
EA + вероятно
EB ( вероятно
EC, ED, EE, EF POS(, LEN(, NUM(, VAL( — без закрывающей скобки подтверждено
F0 FN<имя>( — обращение к функции пользователя; имя следует сырым кодом символа подтверждено
F1 #PI — константа π подтверждено
F2 ABS( подтверждено
F3 INT( подтверждено
F4 RND( подтверждено
F5 SGN( подтверждено
F6 SQR( подтверждено
F7 LOG( подтверждено
F8 EXP( подтверждено
F9, FA, FB, FC математические функции, имена не установлены выведено из данных
FD ARCTAN( вероятно
FE разделитель записей строк подтверждено

Два вида строковых литералов

Строковые константы кодируются двумя разными токенами, и разницу между ними книга[1] объясняет прямым текстом: строки в кавычках система распознаёт и выводит как строки из прописных букв, а строки в апострофах — как строки из строчных. Так на машине, у которой на клавиатуре есть только прописные буквы, задаются строчные символьные константы.

Токен Форма записи Регистр
E3 "…" прописные
E4 '…' строчные

Кодирование одинаковое: <токен> <длина: 1 байт> <длина байт КОИ-8>.

Наблюдения это подтверждают: из 9937 литералов E3 в наборе ни один не содержит строчной кириллицы (C0DF), а из 28 литералов E4 строчную содержат пять — остальные состоят из латиницы и знаков, где регистр неразличим. Правило книги «внутри строки не должно быть кавычек или апострофов» тоже видно: единственный литерал набора, содержащий кавычки, записан апострофами.

E4 3D 35 2D DA C1 D0 CF CC CE C5 CE C9 C5 …
PRINT '5-заполнение полей "номер страницы" и "обозначение документа"'

Разборщик, не знающий токена E4, теряет синхронизацию до конца оператора.

Математические функции

Книга[1] (разд. 4.7) перечисляет пятнадцать функций: SIN, COS, TAN, ARCSIN, ARCCOS, ARCTAN, RND, ABS, INT, SGN, LOG, EXP, SQR, ROUND, #PI. Все они, кроме пяти тригонометрических, размещены по токенам:

  • F1 = #PI. В STAT04 выражение SQR(2*#PI) кодируется как F6 E8 02 DF F1 D0; сверено с текстовой копией той же программы.
  • F4 = RND(. В UDAW: E8 50 DF F4 E8 01 D0 EA E8 1550*RND(1)+15, а в соседней строке 10*RND(1)<9.68.
  • F5 = SGN(. В EDITOR строка 6717: 4E D9 F5 65 E9 04 34 D0 D0 = B%=SGN(B-P%(I)); сверено с текстовой копией.
  • D8 = ROUND( в позиции операнда, см. ниже.
  • FD — вероятно ARCTAN(: в M3 и P3 её единственный аргумент всегда отношение (FD 25 DC 26 D0).

На пять оставшихся имён (SIN, COS, TAN, ARCSIN, ARCCOS) приходится всего четыре свободных токена — F9, FA, FB, FC; программ, сохранённых одновременно в обоих представлениях и использующих тригонометрию, в исследованном наборе нет, поэтому распределение имён по токенам не установлено.

Функции пользователя

Оператор DEFFN <имя>(<формальная переменная>) = <выражение> (глагол 5A) определяет функцию, обращение к ней записывается FN<имя>(<выражение>) и кодируется токеном F0:

5A <имя> <lo> <hi> <формальная переменная> <выражение>
F0 <имя> <выражение> D0

Имя функции — латинская буква либо цифра, и это не индекс переменной: пространства имён разные, одна и та же величина может быть и переменной, и именем функции. Знака равенства в потоке нет: тело следует сразу за байтом формальной переменной. Два байта между именем и формальной переменной — рабочее поле, которое машина заполняет при исполнении; у последнего определения в программе там нули.

Разбор подтверждается тем, что в каждом файле байты после F0 — ровно те имена, которые этот файл определяет оператором DEFFN, и никакие другие. Пример: 5A 48 00 00 2A EB 2A EA F2 2A D0 D0 DC E8 02 = DEFFN H(X)=(X+ABS(X))/2.

Двузначность токенов старшей половины

Часть токенов диапазона D0EF читается по-разному в зависимости от того, ожидается ли на их месте знак операции или очередной операнд. Интерпретатор различает их по состоянию разбора, отдельного признака в файле нет.

Токен В позиции операции В позиции операнда
D2 STEP параметр T оператора SAVE DC
D5 <> AT(
D6 <= BEG; ¤ после DATA SAVE DC и SAVE DC
D7 < END
D8 >= ROUND(
DF * TAB(
E0 ^ ссылка на массив целиком
E9 - бинарный - унарный

Двузначность D8 подтверждена тремя независимыми строками с текстовой сверкой:

2F D9 D8 EF 11 DE DB DC 17 DE E8 01 D0     Y=ROUND(VAL(Y2¤,2)/K7,1)
D8 E5 14 21 17 DF 64 E8 07 D0 DE E8 00 D0  ROUND(2.117*P(7),0)
B1 D9 D8 B1 DC 9A DE E8 00 D0              Q5=ROUND(Q5/P4,0)

В операторе MAT SEARCH знак сравнения стоит в позиции операнда — сразу после запятой, отделяющей искомое значение:

06 0A 08 E0 20 DE D4 22 D1 E0 1E           MAT SEARCH L4¤(),>A¤TON4¤()
06 0A 0F E1 0D E8 01 DE 45 D0 DE D9 E3 01 20 D1 E0 20   MAT SEARCH STR(Q¤,1,M%),=" "TOL4¤()


Внимание

Ссылками на переменные являются значения 00C9, а не 00BF: первый токен — CA (FROM). Индексы C0C9 реально встречаются в крупных программах (в EDITOR 200 переменных), например C1 D9 9C — присваивание переменной с индексом C1. Разборщик с границей C0 портит листинг таких программ.

Ссылка на массив целиком записывается как E0 и порядковый номер переменной в DIM: 74 02 E0 09 соответствует DATA LOAD DC G¤(), а E0 09 D1 E0 00G¤()TOX().

Каждое прочтение подтверждено не менее чем двумя независимыми строками STAT05: TAB(17) кодируется как DF E8 17 D0, а .5*LOG( — как E5 01 50 DF F7; K(1)<>1 и PRINT AT(9,10) оба дают D5; K0*(-1) даёт DF EB E9 E8 01 D0, где E9 стоит в позиции операнда.

Разборщик с одним фиксированным значением на токен на таких строках даёт неверный листинг, поэтому таблицу операндов нужно применять с учётом позиции.

Оператор SELECT

Первый байт операндов — код группы устройств, записи разделяются DE. Ширина строки, если она задана, записывается после EB как двоичное 16-битное число, старший байт первым (не BCD).

Код Группа Пример
00 файл #n: номер, адрес и, необязательно, дисковод 00 01 18 = #118; 00 01 18 00 = #118F
01 без параметров; вероятно режим тригонометрии (SELECT D/R) 54 01 01
05 P — пауза после каждой выводимой строки 05 01 = SELECT P1; 05 = SELECT P
06 устройство, вероятно LIST 06 0C
07 PRINT 07 0C EB 00 82 = SELECT PRINT0C(130)
08 вероятно PLOT 08 10 DE … (адрес 10 — блок отображения графической информации)
0A DISK 0A 18 01 = SELECT DISK18R
0C устройство, вероятно CO 0C 05 EB 00 50

Опознание кодов 01, 06, 08 и 0C косвенное. В книге[1] перечислены группы CI, CO, PRINT, LIST, TAPE, PLOT, DISK, #n и P; строка 300 файла GC121 выполняет 0C 05(80), 07 05(80), 06 05 — типичный возврат CO, PRINT и LIST на экран.

В записях группы 00 дисковод указывается не всегда: SELECT #118 даёт трёхбайтовую запись, SELECT #118F — четырёхбайтовую. Разборщик, всегда читающий четыре байта, съедает разделитель следующей записи.

Числовые константы

Целые константы кодируются двумя токенами в зависимости от величины: E8 — один байт BCD (0–99), E7 — два байта BCD (0–9999).

Для дробных чисел служат токены E5 и E6. За токеном следует байт-описатель, затем цифры числа в BCD по две на байт; если цифр нечётное число, последняя тетрада заполняется нулём. В описателе старшая тетрада — количество цифр до запятой, младшая — общее количество цифр.

Запись Байты Описатель Цифры
.5 E5 01 50 0 / 1 5
.08 E5 02 08 0 / 2 08
2.5 E5 12 25 1 / 2 25
.196854 E5 06 19 68 54 0 / 6 196854
.000344 E5 06 00 03 44 0 / 6 000344

Токен E6 устроен так же, но после цифр мантиссы идёт дополнительный байт порядка: 1E6 кодируется как E6 11 10 06 — одна цифра мантиссы, одна цифра до запятой, порядок 6.

Токен E5 служит и для целых чисел больше 9999 — всего, что не помещается в E7. Дробной части при этом нет, обе тетрады описателя равны:

Запись Байты Описатель Цифры
51840 E5 55 51 84 00 5 / 5 51840
248830 E5 66 24 88 30 6 / 6 248830
2488320 E5 77 24 88 32 00 7 / 7 2488320
2.718281828 E5 1A 27 18 28 18 28 1 / 10 2718281828

Длина хвоста токена — 1 + ⌈младшая тетрада / 2⌉ байт для E5 и на один байт больше для E6. Разборщик, не потребляющий эти байты, теряет синхронизацию до конца оператора; в исследованном наборе E5 встречается в 407 операторах, E6 — в 210.

Номер метки в GOSUB' хранится двоичным, а не в BCD. То же относится к первому байту операндов оператора DEFFN'.

Цепочка операторов DATA

Два последних байта операндов каждого оператора DATAуказатель на следующий оператор DATA, младший байт первым. У последнего оператора DATA в программе он равен 00 00. По этой цепочке работают операторы READ и RESTORE.

Файл Значения указателей
DIG DEM 03C0, 03E7, 040E, 0435, 045C, …, 0594, 0000
M0 0443, 046A, 0491, 04B8, …, 0617, 0000
VICT 0A97, 0ABE, 0AE5, 0B0C, …, 0C6B, 0000

Шаг постоянен, когда постоянна длина операторов, но значения — адреса в памяти интерпретатора, а не смещения в потоке файла, поэтому пересчёт по потоку сходится не всегда.


Внимание

Эти два байта нельзя разбирать как токены. Именно они выглядели как «неопознанные токены» в конце строк DATA: C0 14, C9 04, FA 0E, CF 0B, E4 2C, F9 2C.

Само тело оператора DATA — список значений без разделителей:

29 1E E8 31 E7 03 34 E8 00 E8 28 E7 03 06 E8 31 … C9 04
      31    334      0     28    306      31

Поэтому внутри DATA токены E5, E6 и E7 всегда читаются как константы и никогда как OR/AND, хотя и стоят в позиции операции. То же относится к оператору MAT REDIM, где длина элемента идёт сразу за закрывающей скобкой:

06 02 0A E0 04 EB E7 01 26 D0 E7 01 28        MAT REDIM A¤(126)128

Подпрограммы с параметрами

Аргументы GOSUB' следуют сразу за байтом метки и разделяются токеном DE; скобки не кодируются. Вызов GOSUB ' 5(1,1,N-2) даёт:

23 0B 05 E8 01 DE E8 01 DE 0D E9 E8 02

Объявление DEFFN' содержит метку, четыре байта адреса входа и индексы формальных параметров. Формальные параметры, в отличие от фактических, идут подряд, без разделителей. Объявление DEFFN ' 5(N1,D1,D2) даёт:

27 08 05 00 00 00 00 12 20 21

Четыре байта после метки заполняются интерпретатором при первом обращении к подпрограмме, поэтому нулевыми они бывают только там, где подпрограмму ни разу не звали. В приведённом примере из STAT05 они нулевые, а в EDITOR — осмысленные адреса:

27 08 64 68 02 11 14 4F 50 51             EDITOR 400,  DEFFN ' 100(L1,L4,L3)
27 06 4D 00 00 00 00 3D                   EDITOR 7740, DEFFN ' 77(D)

При разборе эти четыре байта следует пропускать, не пытаясь читать как токены.

Тот же вид имеет и 3A — определение клавиши специальных функций, но за адресом у него стоит ровно один литерал: в кавычках (E3), в апострофах (E4) или шестнадцатеричный (E2). Последний случай встречается в SCOPE:

3A 08 1F 00 00 A4 03 E2 01 0D             DEFFN ' 31 HEX(0D)

Подпрограммой такая метка не является: 3A задаёт текст, подставляемый при нажатии клавиши, и GOSUB' на неё не переходит.

Оператор ON … GOTO кодируется как индекс переменной, токен CD и номера строк по два байта BCD подряд без разделителей.

Неявные функции и уровни скобок

Функции POS(, LEN(, NUM(, VAL( и AT( закрывающей скобки в потоке не имеют: они заканчиваются на первом же знаке операции. Важно, что «своего» уровня — закрывающая скобка D0, принадлежащая вложенной явной скобке, такую функцию не закрывает.

EDITOR, строка 265:
EC  E1  E0 2A  E8 01  D0  D7  DE 20  D5  E8 00  D3 02 70
POS(STR( V¤()  , 1    )   <   20     )   <>  0   THEN 270

Здесь D0 закрывает только STR(; POS( остаётся открытой и заканчивается на D5. Разборщик, считающий неявные скобки одним счётчиком, выдаст POS(STR(V¤(),1))<20<>0 — с потерей смысла. Правильная модель — стек: на каждую явную скобку (включая список индексов массива) заводится уровень, неявные функции считаются внутри текущего уровня, а D0 закрывает сначала неявные функции своего уровня, затем сам уровень.

Что не кодируется и восстанавливается по форме оператора

Часть знаков препинания в потоке отсутствует: их положение определяется синтаксисом конкретного оператора, а не токенами.

Оператор В потоке В листинге
INIT 64 04 E3 01 2D 15 INIT ("-")U¤ — значение в скобках, запятой нет
CONVERT 47 0F 48 D1 E1 … D0 E3 02 «##» CONVERT P% TO STR(…),(##) — образ в скобках
¤GIO с адресом 40 0D DC DE 34 DE E2 06 … 22 ¤GIO /34,(HEX(…),A¤)
¤GIO с апострофом 40 … D5 E2 … 07 … ¤GIO 'HEX(…),D¤(2) — здесь скобок нет
VERIFY 83 … 02 DB 39 E8 01 D0 DE 16 … 17 … VERIFY T#D%(1),(X(1),Y(1))
¤TRAN( 06 0C 06 0D DE 12 D0 DE 00 ¤TRAN(Q¤,L0¤)R — запятая после ) не печатается
LABEL 06 1E 0A E0 1F E8 03 DE DE DE E3 01 51 LABEL B¤()3,,,"Q"
MAT 06 01 04 E0 54 D9 EF MAT C%=ZER — имя массива без ()
RESTORE 51 05 E8 01 DE 48 50 RESTORE 1,4850 — номер строки сырым BCD
SAVE, LOAD 2A 0A DD 10 52 15 DE 52 15 DE 52 25 SAVE Z¤5215,5215,5225 — диапазон строк сырым BCD
INPUT, LINPUT 06 24 2C E3 28 … E9 32 LINPUT "…",-L¤ — запятая перед унарным минусом неявная


Внимание

Ссылка на массив целиком (E0 <индекс>) — законченное значение: после неё разбор ожидает операцию или следующий элемент списка, а не индекс. В операторах, операнды которых представляют собой список значений (INPUT, READ, LINPUT, INIT, ¤GIO, DATA LOAD/SAVE, LIMITS, MAT READ, MAT INPUT), возведения в степень быть не может, поэтому E0 там всегда ссылка на массив. Иначе строка DATA LOAD DA T#D%(D),(X(D))D¤,N¤(),T¤(),L¤(),B(D) читается как …D¤^N¤()^T¤()….

Операторы, у которых закрывающая скобка не кодируется

У глаголов, имя которых оканчивается на (, закрывающей скобки в потоке нет:

Глагол Форма Где находится закрывающая скобка
43 AND(, 61 OR(, 62 XOR( AND(A¤,B¤) в конце операторной части
48 PACK(, 5D UNPACK(, 06 0C ¤TRAN( PACK(<формат>)… сразу за литералом формата
4B BIN( BIN(<приёмник>[,2])=<выражение> после приёмника, вместе со знаком =
4B 02 22 3B                                   BIN(A¤)=J%
4B … E1 23 36 D0 E8 13 DE E8 02 D0 DE DB EF … BIN(STR(A¤(I),13,2),2)=VAL(…)

Пара DE DB здесь означает «,2» — так же, как во втором аргументе функции VAL(. Смысл этого аргумента даёт руководство[1]: VAL( «преобразует двоичное значение содержимого первого байта или первых двух байтов» символьной переменной, то есть аргумент задаёт число байт, и грамматика допускает единственное значение 2. Отсюда и отдельный токен вместо константы: DB в этой позиции и означает двойку, операндов у него нет. Порядок байт — старший первым, по приведённому в руководстве тождеству VAL(X¤,2) = VAL(X¤)*256 + VAL(STR(X¤,2)).

Индексация массивов

У обращения к элементу массива нет открывающей скобки: ссылка на переменную сама открывает список индексов, а D0 его закрывает.

01 32 D0        →  01(32)
2A 03 E8 01 D0 D0  →  2A(03,1)

Токен EB используется только как группирующая скобка в выражениях:

EB 34 E9 33 E9 E8 01 D0  →  (34*33*1)

Разборщик, ожидающий EB перед индексом массива, рассинхронизируется.

Поток значений переменных

Секторы, следующие за программой в токенизированном файле, содержат значения переменных, записанные в том же формате, что и обычные файлы данных. Структура описана в документации[1].

Служебная информация в секторе двух видов:

  • идентификатор сектора — 1 байт в начале сектора, значение 02 (признак данных);[2] под данные остаются 255 байт;
  • идентификатор значения — 2 байта перед каждым значением, содержат тип (числовое или символьное) и длину.

Размеры значений:

Тип Значение Со служебными байтами Значений в секторе
целое 2 байта 4 байта 63
действительное 8 байт 10 байт 25
символьное длина значения длина + 2

Значение, не помещающееся в секторе целиком, переносится в следующий сектор полностью. Элементы массивов записываются построчно.

Пример

В файле DIG DEM сектор данных начинается с идентификатора сектора 02, за которым идут 25 записей по 10 байт:

00 08 <8 байт значения>

Идентификатор 00 08 означает числовое значение длиной 8 байт. Двадцать пятая запись заканчивается на пятом байте от конца сектора, оставшиеся 5 байт не используются: 1 + 25 × 10 + 5 = 256. Расчёт сходится точно и подтверждает однобайтовую длину идентификатора сектора.

Алгоритм разбора

  1. Прочитать запись каталога: первый и последний сектор, тип должен быть 80.
  2. Прочитать первый сектор: проверить байт 0 = 01, взять имя, прочитать байт 9.
  3. Проверить наличие четырёхбайтового поля перед программой: если по смещению 6 + L1 + L2 + L3 корректной записи строки нет, а по смещению на четыре больше есть — сдвинуть начало.
  4. Если байт 9 = 20: склеить содержимое секторов, разбить по 85, отбросить нули, перекодировать КОИ-8. Готово.
  5. Если байт 9 = 21: собрать поток из секторов с байтом 1 = 80, беря с каждого ровно 254 байта без обрезки хвостовых нулей; прочитать L1, L2, L3; перейти к смещению 6 + L1 + L2 + L3.
  6. Построить таблицу переменных: N = L2/4 + L3/4; для каждой позиции pos индекс равен N − 1 − pos, тип берётся из флага; записи с установленным битом 0 флага по порядку сопоставляются записям таблицы 1.
  7. Для каждой записи строки: номер строки из двух байтов BCD, длина из третьего, тело до следующего FE. Если по отсчитанной длине не оказалось FE — поток рассинхронизирован, разбор остановить.
  8. После FE: если весь остаток текущего 254-байтового куска нулевой, перейти к началу следующего куска.
  9. Тело разрезать на операторы по схеме <глагол><len><операнды>, учитывая двухбайтовые глаголы с префиксом 06.
  10. Перед разбором операндов учесть особые формы: у DATA два последних байта — указатель цепочки, у дисковых операторов первый байт — код F/R/T, у GOSUB' и DEFFN' первый байт — двоичная метка, у SELECT и SCRATCH DISK — собственный формат.

Обработку файла следует прекращать на первом встреченном секторе с маркером 1C, а не доходить до конца выделенного диапазона: за control record могут лежать остатки предыдущей, более длинной версии файла.

Число записей в таблицах 2 и 3 равно L2 / 4 и L3 / 4 — запись в них вдвое короче, чем в таблице 1.

Байт длины в каждой записи и в каждом операторе даёт бесплатную проверку целостности на каждом шаге. Дополнительная проверка — совпадение числа записей таблиц 2 и 3 с установленным битом 0 флага и числа записей таблицы 1 (L1 / 8).

Отличия от Wang 2200

Wang 2200 Искра-226
Запись каталога 16 байт совпадает побайтово
Маркер control record 20 1C
Маркер заголовка 40 (50 для защищённых) 01
Маркеры секторов битовое поле в старшей тетраде отдельные значения 02/8F/03
Конец строки в программе 0D 00 00 FE как разделитель
Конец блока FD (EOB) / FE (EOD) не используется
Диапазон токенов 0x80–0xFB, 124 значения глаголы 0x1E–0x83, операнды 0xCA–0xFE, индексы переменных 0x00–0xC9
Текст в программе ключевые слова в токенах, остальное обычный ASCII всё в токенах, ASCII только внутри строковых литералов
Переменные имена в открытом виде индексы в таблицу, имена не хранятся
Длина оператора отсутствует обязательный байт после каждого глагола

Таблицы токенов не имеют между собой ничего общего: систематического сдвига нет, совпадений по отдельным байтам нет. Инструментарий Wang для детокенизации переиспользовать нельзя. Совпадает только уровень файловой системы.

Вероятная причина расхождения — кодировка. В Wang верхняя половина таблицы свободна и отдана под ключевые слова; у Искры она занята кириллицей, поэтому глаголы перенесены вниз, а от литерального ASCII в потоке отказались полностью.

Не установлено

  1. Полная таблица токенов: часть значений в диапазонах 0x31–0x32, 0x38–0x39, 0x3B–0x3E, 0x49, 0x4F, 0x5B, 0x60, 0x65, 0x67, 0x69–0x6C, 0x73, 0x7F не занята в известной таблице.
  2. Имена операторов у глаголов 33, 37, 63, 72, у подкодов 06 09, 06 0D, 06 0E, а также у 06 00 (вероятно PLOT).
  3. Распределение имён SIN, COS, TAN, ARCSIN, ARCCOS по свободным токенам F9, FA, FB, FC: программ с тригонометрией, сохранённых сразу в обоих представлениях, в наборе нет.
  4. Назначение четырёхбайтового поля 0A 19 <BCD> перед программой.
  5. Смысл поля по смещению 4–5 записи таблицы 1 у скалярных символьных переменных: у массивов там число элементов, у скаляров значения образуют ряд с шагом около 6 в порядке объявления независимо от длин, что указывает скорее на указатель, чем на характеристику самой переменной.
  6. Смысл байта 3 записей таблиц 2 и 3, а также битов 7 и 3 флага.
  7. Смысл поля 0–1 записей таблиц 2 и 3 у переменных, имеющих дескриптор в таблице 1: это не адрес, а небольшое число, растущее примерно на восемь.
  8. Однобайтовый операнд у AND(, OR(, XOR(: 43 03 15 DE F0 = AND(A¤,F0), 61 06 00 E8 01 D0 DE FF = OR(A¤(1),FF). Похоже на шестнадцатеричную маску без HEX(), но правило, по которому она отличается от ссылки на переменную, неизвестно.
  9. Причина различия разметки секторов между токенизированными и текстовыми потоками: в текстовых файлах наблюдается позиционная схема 02/8F/03, в токенизированных все секторы программы идут с маркером 02.
  10. Токены операторов, встречающихся в указателе книги, но не найденных в наборе: DATA SAVE DA END, MOVE END, COM CLEAR, CLEAR N/P/V, LIST V, LIST *, LIST %, LIST ¤.

Примечания

  1. 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 1,10 1,11 Баласанян В. Э., Богдюкевич С. В., Шахвердов В. А. Программирование на микроЭВМ «Искра 226». — М.: Финансы и статистика, 1987. — 264 с.: ил. — разделы 5.1, 5.2, 11.5, 14.2, 18.1, 18.4, 18.7.
  2. 2,0 2,1 2,2 Аладьев В. З. и др. Персональный компьютер «Искра-226». Архитектура и программное обеспечение: справочное руководство. — Киев, 1988. — структура программного файла и файла данных, значения признака защиты.

Источники

  • Баласанян В. Э., Богдюкевич С. В., Шахвердов В. А. Программирование на микроЭВМ «Искра 226». — М.: Финансы и статистика, 1987. — 264 с.: ил.
  • Реконструкция по образам дисков: файлы TRANSFER, ФС (текстовые), DIG DEM, #СТАТИСТ, ДЕМ6 (токенизированные), EDITOR (сохранён в обоих представлениях — 182 сектора, 1422 строки; основной материал для проверки структуры таблиц и таблицы токенов), STAT05 (защищённый и оттранслированный, с расчётами с плавающей точкой; материал для разбора формата констант и двузначности токенов), STAT01A (защищённый и оттранслированный; единственный образец с двумерным массивом), STAT00 (защищённый и оттранслированный, сокращённая версия той же программы; материал для разбора двухбайтовых глаголов), М1.Х (сохранён в обоих представлениях; единственный образец с оператором COM и непустой таблицей 3, а также с шестью двумерными массивами), STAT03 и STAT08 (защищённые и оттранслированные; материал для разбора условий появления дополнительных дескрипторов при MAT REDIM, а STAT08 — единственный оттранслированный файл с заполненными адресами в таблице 1).

Дамп STAT01A снят с удалённого файла, поэтому его целостность не гарантирована; выводы по нему опираются только на таблицу 1 и операторы DIM, взаимно согласованные по всем 23 объявленным переменным.

Расшифрованный листинг EDITOR получен ранней версией инструментария и содержит дефект: в нём полностью отсутствует символ < (ноль вхождений при сотне вхождений >), из-за чего строки вида IF N¤"????"THEN202 выглядят без знака сравнения, хотя в токенах он есть (D5). Для сверки предпочтительны листинги STAT0x, VICT и M1.

При сверке представлений следует учитывать, что текстовая и оттранслированная копии одной программы на диске могут относиться к разным её версиям. В STAT05 текстовый листинг строки 240 содержит вызов ABS, отсутствующий в оттранслированной копии, что подтверждается длиной оператора. У EDITOR расхождения версий заметны по номерам строк в THEN.

  • Расширенный набор (2026): 51 оттранслированный файл и 28 текстовых листингов, в том числе 12 пар «текст + токены»: EDITOR, M1, VICT, STAT00, STAT001, STAT01, STAT02, STAT03, STAT04, STAT05, STAT08, STAT09. Ключевые для этой статьи: STAT04 (константы, #PI), STAT09 (полный набор дисковых операторов), VICT (единственная пара с целыми переменными), M1 (оператор COM), STAT03 (поведение MAT REDIM), M4 и FAN01 (графические операторы DOT и DDRAW), S1, S2, GC121 (IF END THEN), UDAW (RND).
  • Таблица глаголов — из прошивки интерпретатора, по материалам проекта elaranovikova/iskra226.
  • Аладьев В. З. и др. Персональный компьютер «Искра-226». Архитектура и программное обеспечение: справочное руководство. — Киев, 1988.
  • Структура файловой системы Wang для сопоставления — Wang 2200 Disk Organization.