Создание лексического анализатора простого языка программирования — различия между версиями

Материал из Вики ИТ мехмата ЮФУ
Перейти к: навигация, поиск
(Глобальные переменные, необходимые для работы лексического анализатора:)
(Модуль лексического анализатора)
Строка 41: Строка 41:
 
   Лексемы:
 
   Лексемы:
 
   ;  :=  +=  -=  *=  id  num  begin  end  cycle
 
   ;  :=  +=  -=  *=  id  num  begin  end  cycle
 
+
 
   Ключевые слова:
 
   Ключевые слова:
 
   begin  end  cycle
 
   begin  end  cycle
 
}
 
}
 
unit SimpleLangLexer;
 
unit SimpleLangLexer;
 
+
 
interface
 
interface
 
+
 
// TLex - перечислимый тип - все лексемы грамматики
 
// TLex - перечислимый тип - все лексемы грамматики
 
// lexEot - конец текста программы
 
// lexEot - конец текста программы
 
type  
 
type  
 
   TLex = (lexId,lexNum,lexSemicolon,lexAssign,lexAssignPlus,lexAssignMinus,lexAssignMult,lexBegin,lexEnd,lexCycle,lexEot);
 
   TLex = (lexId,lexNum,lexSemicolon,lexAssign,lexAssignPlus,lexAssignMinus,lexAssignMult,lexBegin,lexEnd,lexCycle,lexEot);
 
+
 
var  
 
var  
 
   fname: string;          // Имя файла программы
 
   fname: string;          // Имя файла программы
 
   LexRow,LexCol: integer;  // Строка-столбец начала лексемы. Конец лексемы = LexCol+Length(LexText)
 
   LexRow,LexCol: integer;  // Строка-столбец начала лексемы. Конец лексемы = LexCol+Length(LexText)
   LexKind: TLex;               // Тип лексемы   
+
   LexKind: TLex;           // Тип лексемы   
 
   LexText: string;        // Текст лексемы
 
   LexText: string;        // Текст лексемы
 
   LexValue: integer;      // Целое значение, связанное с лексемой lexNum
 
   LexValue: integer;      // Целое значение, связанное с лексемой lexNum
 
+
 
procedure NextCh;
 
procedure NextCh;
 
procedure PassSpaces;
 
procedure PassSpaces;
Строка 67: Строка 67:
 
procedure Done;
 
procedure Done;
 
procedure lexerror(message: string := '');
 
procedure lexerror(message: string := '');
 
+
 
implementation
 
implementation
 
+
uses System.Collections.Generic;
 
 
 
 
var  
 
var  
 
   ch: Char;        // Текущий символ
 
   ch: Char;        // Текущий символ
Строка 77: Строка 75:
 
   row,col: integer; // Текущие строка и столбец в файле
 
   row,col: integer; // Текущие строка и столбец в файле
 
   KeywordsMap := new Dictionary<string,TLex>; // Словарь, сопоставляющий ключевым словам константы типа TLex. Инициализируется процедурой InitKeywords
 
   KeywordsMap := new Dictionary<string,TLex>; // Словарь, сопоставляющий ключевым словам константы типа TLex. Инициализируется процедурой InitKeywords
 
+
procedure lexerror(message: string);
+
procedure lexerror(message: string); // ошибка лексического анализатора
 
begin
 
begin
 
   var ss := System.IO.File.ReadLines(fname).Skip(row-1).First(); // Строка row файла
 
   var ss := System.IO.File.ReadLines(fname).Skip(row-1).First(); // Строка row файла
Строка 89: Строка 87:
 
   halt;
 
   halt;
 
end;
 
end;
 
+
 
procedure NextCh;
 
procedure NextCh;
 
begin
 
begin
Строка 105: Строка 103:
 
     end;
 
     end;
 
   end
 
   end
   else ch := #0;
+
   else ch := #0; // если достигнут конец файла, то возвращается #0
 
end;  
 
end;  
 
+
 
procedure PassSpaces;
 
procedure PassSpaces;
 
begin
 
begin
Строка 113: Строка 111:
 
     NextCh;
 
     NextCh;
 
end;
 
end;
 
+
 
procedure NextLexem;
 
procedure NextLexem;
 
begin
 
begin
 
   PassSpaces;
 
   PassSpaces;
 +
  // R К этому моменту первый символ лексемы считан в ch
 
   LexText := '';
 
   LexText := '';
 
   LexRow := Row;
 
   LexRow := Row;
Строка 142: Строка 141:
 
       end;
 
       end;
 
   '0'..'9': begin
 
   '0'..'9': begin
         while ch in ['0'..'9'] do
+
         while char.IsDigit(ch) do
 
           NextCh;
 
           NextCh;
 
         LexValue := integer.Parse(LexText);
 
         LexValue := integer.Parse(LexText);
Строка 151: Строка 150:
 
   end;   
 
   end;   
 
end;
 
end;
 
+
 
procedure InitKeywords;
 
procedure InitKeywords;
 
begin
 
begin
Строка 158: Строка 157:
 
   KeywordsMap['cycle'] := lexCycle;
 
   KeywordsMap['cycle'] := lexCycle;
 
end;
 
end;
 
+
 
procedure Init(fn: string);
 
procedure Init(fn: string);
 
begin
 
begin
Строка 166: Строка 165:
 
   reset(f);
 
   reset(f);
 
   row := 1; col := 1;
 
   row := 1; col := 1;
   NextCh;
+
   NextCh;   // Считать первый символ в ch
   NextLexem;
+
   NextLexem; // Считать первую лексему, заполнив LexText, LexKind и, возможно, LexValue
 
end;
 
end;
 
+
 
procedure Done;
 
procedure Done;
 
begin
 
begin
Строка 175: Строка 174:
 
end;
 
end;
 
   
 
   
end.
+
end.</source>
 
 
</source>
 
 
===== Задания =====
 
===== Задания =====
  

Версия 10:38, 15 августа 2014

К основной странице курса

Предварительные замечания

Лексемы языка:
 ;  :=  +=  -=  *=  id  num  begin  end  cycle

Здесь

 id - идентификатор
 num - целое без знака
 begin  end  cycle - ключевые слова
Глобальные переменные, необходимые для работы лексического анализатора:
 fname: string;           // Имя файла программы
 LexRow,LexCol: integer;  // Строка-столбец начала лексемы. Конец лексемы = LexCol+Length(LexText)
 LexKind: TLex;           // Тип лексемы   
 LexText: string;         // Текст лексемы
 LexValue: integer;       // Целое значение, связанное с лексемой lexNum

Тип TLex является перечислимым и содержит все возможные лексемы нашего языка, а также специальную лексему lexEot конца текста:

 TLex = (lexId,lexNum,lexSemicolon,lexAssign,lexAssignPlus,lexAssignMinus,lexAssignMult,lexBegin,lexEnd,lexCycle,lexEot);
Вспомогательные глобальные переменные, описанные в секции реализации модуля:
 ch: Char;         // Текущий символ
 f: text;          // Текущий файл
 row,col: integer; // Текущие строка и столбец в файле
 KeywordsMap := new Dictionary<string,TLex>; // Словарь, сопоставляющий ключевым словам константы типа TLex. 
                                             // Инициализируется процедурой InitKeywords
Процедура NextCh

Помимо считывания следующего символа ch, процедура NextCh поддерживает в актуальном состоянии текущие строку-столбец (row,col). При достижении конца файла в переменную ch возвращается специальный символ #0

Процедура InitKeywords

Процедура InitKeywords инициализирует словарь ключевых слов KeywordsMap. Этот словарь ставит в соответствие строке ключевого слова константу типа TLex:

KeywordsMap['begin'] := lexBegin;

Модуль лексического анализатора

// Распознавание программы на простом языке. Распознаватель лексем (лексер)
{ 
  Лексемы:
  ;  :=  +=  -=  *=  id  num  begin  end  cycle
 
  Ключевые слова:
  begin  end  cycle
}
unit SimpleLangLexer;
 
interface
 
// TLex - перечислимый тип - все лексемы грамматики
// lexEot - конец текста программы
type 
  TLex = (lexId,lexNum,lexSemicolon,lexAssign,lexAssignPlus,lexAssignMinus,lexAssignMult,lexBegin,lexEnd,lexCycle,lexEot);
 
var 
  fname: string;           // Имя файла программы
  LexRow,LexCol: integer;  // Строка-столбец начала лексемы. Конец лексемы = LexCol+Length(LexText)
  LexKind: TLex;           // Тип лексемы   
  LexText: string;         // Текст лексемы
  LexValue: integer;       // Целое значение, связанное с лексемой lexNum
 
procedure NextCh;
procedure PassSpaces;
procedure NextLexem;
procedure Init(fn: string);
procedure Done;
procedure lexerror(message: string := '');
 
implementation
 
var 
  ch: Char;         // Текущий символ
  f: text;          // Текущий файл
  row,col: integer; // Текущие строка и столбец в файле
  KeywordsMap := new Dictionary<string,TLex>; // Словарь, сопоставляющий ключевым словам константы типа TLex. Инициализируется процедурой InitKeywords
 
procedure lexerror(message: string); // ошибка лексического анализатора
begin
  var ss := System.IO.File.ReadLines(fname).Skip(row-1).First(); // Строка row файла
  writeln('Лексическая ошибка в строке ',row,':');
  writeln(ss);
  writeln('^':col-1);
  if message<>'' then 
    writeln(message);
  Done;  
  halt;
end;
 
procedure NextCh;
begin
  // В LexText накапливается предыдущий символ и считывается следующий символ
  LexText += ch;
  if not eof(f) then
  begin
    read(f,ch);
    if ch<>#10 then
      col += 1
    else
    begin
      row += 1;
      col := 1;
    end;
  end
  else ch := #0; // если достигнут конец файла, то возвращается #0 
end; 
 
procedure PassSpaces;
begin
  while char.IsWhiteSpace(ch) do
    NextCh;
end;
 
procedure NextLexem;
begin
  PassSpaces;
  // R К этому моменту первый символ лексемы считан в ch
  LexText := '';
  LexRow := Row;
  LexCol := Col;
// Тип лексемы определяется по ее первому символу
// Для каждой лексемы строится синтаксическая диаграмма
  case ch of
  ';': begin
         NextCh;
         LexKind := lexSemicolon;
       end;  
  ':': begin
         NextCh;
         if ch<>'=' then 
           lexerror('= ожидалось');
         NextCh;
         LexKind := lexAssign;
       end;
  'a'..'z': begin
         while ch in ['a'..'z','0'..'9'] do
           NextCh;
         if KeywordsMap.ContainsKey(LexText) then
           LexKind := KeywordsMap[LexText]
         else LexKind := lexId;
       end;
  '0'..'9': begin
         while char.IsDigit(ch) do
           NextCh;
         LexValue := integer.Parse(LexText);
         LexKind := lexNum;
       end;
    #0: LexKind := lexEot;   
    else lexerror('Неверный символ '+ch);
  end;  
end;
 
procedure InitKeywords;
begin
  KeywordsMap['begin'] := lexBegin;
  KeywordsMap['end'] := lexEnd;
  KeywordsMap['cycle'] := lexCycle;
end;
 
procedure Init(fn: string);
begin
  InitKeywords;
  fname := fn;
  assign(f,fname);
  reset(f);
  row := 1; col := 1;
  NextCh;    // Считать первый символ в ch
  NextLexem; // Считать первую лексему, заполнив LexText, LexKind и, возможно, LexValue
end;
 
procedure Done;
begin
  close(f);
end;
 
end.
Задания
  1. Добавить распознавание лексем : , + - * / div mod and or not
  2. Добавить распознавание лексем += -= *= /=. Тщательно продумать, как совместить распознавание лексем с одинаковым префиксом: например, + и +=
  3. Добавить распознавание лексем > < >= <= = <>
  4. Добавить пропуск комментариев // - до конца строки
  5. Добавить пропуск комментариев { комментарий до закрывающей фигурной скобки }. Обратить внимание, что незакрытый до конца файла комментарий - это синтаксическая ошибка
  6. Добавить распознавание вещественного с фиксированной точкой: 3.14. Его лексическое значение должно быть вещественным. Для этого сделать LexValue записью с полями LexValueInteger,LexValueReal,LexValueString и пополнять ее новыми полями других типов по мере необходимости. Выбор поля, которое следует инициализировать в LexValue (или не инициализировать никакое) определяется значением LexKind
  7. Добавить распознавание строкового литерала: 'abc'. Его лексическое значение должно быть строковым.